Sukčiavimo el. laiškų atpažinimas, taikant duomenų gavybos metodus
Darbo tikslas - iš dalies automatizuoti sukčiavimo laiškų atpažinimą, taikant programinės įrangos kaip paslaugos sprendimus ir elektroninių laiškų klasifikavimo metodus, paremtus elektroninio laiško konteksto išskyrimu.Darbe nagrinėjamas sukčiavimo elektroninių laiškų atpažinimas, taikant duomenų gavybos metodus. Išanalizuota sukčiavimo elektroninių laiškų probleminė sritis ir atpažinimo, prevencijos aktualumas. Aprašyti ir išnagrinėti tekstinių duomenų klasifikavimo etapai. Aprašyti ir išanalizuoti tekstinių duomenų gavybai bei paruošimui taikomi metodai ir iš jų pasirinktas optimaliausias. Išnagrinėti sukčiavimo elektroninių laiškų atpažinimui taikomi metodai ir iš jų pasirinkti optimaliausi. Išanalizuoti sukčiavimo elektroninių laiškų atpažinimui taikomi įrankiai ir parinkti optimaliausi. Aprašyta ir pateikta sukčiavimo elektroninių laiškų klasifikavimo įrankių realizacija: kiekvieno klasifikatoriaus kūrimas ir apmokymas, taikant programinės įrangos kaip paspaugos sprendimą ir suklastotų elektroninių laiškų, brukalo duomenų rinkinį. Atlikti bandymai, taikant sukurtus klasifikavimo įrankius ir suklastotų, teisėtų, brukalo elektroninių laiškų sąrašą. Pateikti, išanalizuoti ir palyginti bandymų metu gauti rezultatai.Atsižvelgiant į gautus rezultatus pateiktas elektroninių laiškų atpažinimo įrankis, paremtas laiško konteksto išskyrimu.Darbą sudaro: įvadas, 3 skyriai, išvados, literatūros sąrašas, santrumpų aiškinamasis žodynas, priedai.Darbo apimtis - 86 p. teksto be priedų, 36 iliustr., 10 lent., 52 bibliografiniai šaltiniai.Atskirai pridedami darbo priedai.
The aim of the work is to partially automate the detection of phishing e-mails using software as a service solutions and e-mail classification methods based on e-mail context extraction.The paper examines the identification of fraudulent e-mails by using data mining methods. The problem area of fraudulent e-mails and the relevance of detection and prevention are analyzed. Described and analyzed stages of textual data classification. The methods used for the extraction and preparation of textual data are described and analyzed and the most optimal one is selected. The methods used for electronic e-mails detection of fraud have been analyzed and the most optimal ones have been selected. The tools used to detect fraudulent e-mails were analyzed and the most optimal ones were selected. Described and presented the implementation of fraudulent email classification tools: development and training of each classifier using software as a service solution and a set of phishing, spam e-mails. Tests were performed using the developed classification tools and a list of phishing, legitimate, spam emails. The results obtained during the tests are presented, analyzed and compared.Based on the results obtained, an email recognition tool based on the exclusion of the context of the email is presented.Structure: introduction, 3 chapters, conclusions and suggestions, glossary of terms, references, appendixes.Thesis consist of - 86 p. text without appendixes, 36 pictures, 10 tables, 52 bibliographical entries.Appendixes included.