Scientific Spam Detection Using Neural Network
Veluswamy, Sabarish |
Baigiamajame magistro darbe pasiūlyta aptikti nepageidaujamus elektroninius laiškus naudojant neuroninius tinklus. Kadangi yra įvairių metodų šlamšto aptikimui aptikti, tačiau nėra vieno metodo / technologijos moksliniam šlamštui aptikti, todėl siūlomas metodas naudojant raktinius žodžius (mokslinio šlamšto suaktyvinimo žodžiai, grobuoniškos konferencijos ir žurnalų sąrašas) ir su kai kuriomis papildomomis funkcijomis iš el. Pašto antraštės ir turinio. .Siūloma metodika naudoja ”Java” kodą reikalingoms funkcijoms išgauti iš el. Laiško turinio ir antraštės duomenų rinkiniams sudaryti. Iš viso išgaunama 650 pranešimų (350-400 mokslinių žinučių apie šlamštą ir 250 žinučių). Yra 3 duomenų rinkiniai ir kiekviename duomenų rinkinyje yra atskira saugomų duomenų forma. Šis duomenų rinkinys bus apmokytas ir išbandytas (60 proc. - mokymui ir 40 proc. - testavimui), naudojant 2 skirtingus neuroninio tinklo įrankius. Norėdami sužinoti duomenų rinkinio tikslumą ir efektyvumą.”Weka” naudoja daugiasluoksnį perceptroną duomenų rinkimui ir testavimui, o ”Matlab” naudoja „Neural Network” priemonių rinkinį (NN toolbox) duomenims mokyti ir tikrinti. Šie duomenys buvo apmokyti ir išbandyti suskaidžius duomenis į skirtingus segmentus, įvertinant kiekvieno modelio segmentų modeliavimo ir tikslumo laiką atitinkamai ”Weka” ir ”Matlab”.Buvo palygintas ir paaiškintas kiekvieno segmento tikslumas ir modeliavimo laikas bei visi duomenys ”Weka” ir ”Matlab”.Darbą sudaro 6 dalys: įvadas, susijusių darbų analizė, siūlomos tyrimo metodikos, siūlomos metodikos įgyvendinimas, išvados, literatūros sąrašas.Darbo apimtis - 64 p. teksto be priedų, 29 paveikslai, 9 lentelės, 31 bibliografinis šaltinis.
In the final master thesis, detection of scientific spam emails using Neural Networks have been proposed. Since there are various methodologies to detect spam messages but there is no single method/ technology to detect scientific spam so a method is proposed using keywords (Scientific spam trigger words, predatory conference and journal list) and with some additional features from email header and body. Proposed methodology uses Java code to extract the necessary features from the email body and header to form the datasets. It extracts a total of 650 messages (350-400 scientific spam messages and 250 ham messages). There are 3 datasets and each dataset has separate form of data stored. These dataset will be trained and tested (60% for training and 40% for testing) using 2 different Neural Network tools inorder to find the accuracy and efficiency of the dataset.Weka uses multi-layer perceptron to train and test the dataset while Matlab uses Neural Network toolbox (NN toolbox) to train and test the data. These data has been trained and tested with splitting the data into different segments ans evaluating the time taken for modelling and accuracy of each segment in Weka and Matlab respectively.Accuracy and modelling time that are evaluated for each segment and whole data in Weka and Matlab has been compared and explained. Structure: introduction, related work analysis, proposed research methodology, implementation of proposed methodology, conclusions, references. Thesis consist of 64 p. text without appendixes, 29 pictures, 9 tables, 31 bibliographical entries.