Teksto panašumų nustatymas dokumentų valdymo sistemose
Čerbauskas, Marius |
Šiame darbe nagrinėjami tekstų panašumo nustatymo būdai ir metodai. Pagrindinė darbe keliama problema yra ta, kad esami teksto panašumo nustatymo algoritmai nėra pakankamai tikslūs, o jų greitaveika stipriai priklauso nuo duomenų kiekio, todėl būtina atlikti tyrimus, susijusius su teksto panašumo nustatymo algoritmų tobulinimu. Darbe analizuojami praktikoje plačiausiai naudojami teksto panašumų nustatymo metodai. Analizuojamas eilučių tapatumo aptikimo algoritmų veikimo našumas, teksto „klasterizavimo” ypatumai pasitelkiant neprižiūrimąjį mašininį mokymą (angl. unsupervised machine learning), išbandomi vieni populiariausų Jaccard ir Cosine algoritmai, palyginamas jų efektyvumas. Atlikus eksperimentinį tyrimą, pasiūlytas duomenų „klasterizavimo” gerinimo būdas naudojant GMM algoritmą, Jaccard panašumų nustatymo algoritmo efektyvumo gerinimo modelis.Darbo apimtis - 74 p. teksto be priedų, 41 iliustr., 11 lent., 64 bibliografiniai šaltiniai.Atskirai pridedami darbo priedai.
This thesis covers up the analysis of text similarity identification tools and methods. The main idea of this work is that currently many methods are known that are capable of detecting text which was either duplicated, paraphrased or modified in some other way. The problem is that those methods are not effective enough. They are either too slow when working with big datasets or they lack precission. That is why this work proposes ways to improve these algorithms. The proposed ways include improving the clustering results by using GMM algorithm instead of K-means, also the usage of Jaccard algorithm was implemented with MinHash algorithm which gave better precision with detecting large sets of data. Thesis consist of: 74 p. text without appendixes, 41 pictures, 11 tables, 64 bibliographical entries.Appendixes included.