Lietuvių šnekamosios kalbos duomenų bazė balso kodekų kokybės tyrimui
Mulma, Kšyštof | Telekomunikacijų inžinerijos katedra |
Baigiamajame magistro darbe aprašomas lietuvių šnekamosios kalbos garso įrašų duomenų bazės, skirtos balso kodekų kokybės tyrimams, sukūrimas. Apžvelgiamos panašios garso įrašų duomenų bazės. Nustatomi reikalavimai lietuvių kalbos įrašų duomenų bazei. Remiantis atliktais tyrimais parenkami žodžiai, dažniausiai vartojami lietuvių kalboje, ir sudaromi sakiniai. Duomenų bazė yra įgarsinama 16 skirtingų kalbėtojų, iš kurių 8 moterys ir 8 vyrai. Sukurtos lietuvių kalbos įrašų duomenų bazės tinkamumas įvertinamas taikant ITU-T rekomendacijoje P.563 aprašytą 3SQM garso įrašų kokybės vertinimo algoritmą. Gauti rezultatai yra palyginami su kitų kalbų įrašais. Naudojantis sukurta lietuvių kalbos įrašų duomenų baze ir ITU- T rekomendacijos P.50 priedo kitų kalbų garso įrašais atliekami AMR ir Speex balso kodekų kokybės vertinimai. Kodekų kokybė vertinama ITU-T rekomendacijoje P.862 aprašytu PESQ algoritmu ir auditoriniu klausymosi testu pagal ITU T rekomendaciją P.800. Kokybės vertinimų rezultatai pateikiami MOS skalėje. Tezių pabaigoje formuluojamos išvados.Darbą sudaro 7 dalys: įvadas, kalbos įrašų duomenų bazių apžvalga, sakinių sudarymas duomenų bazei įgarsinti, balso kodekų tyrimas, išvados, literatūros sąrašas, priedas. Darbo apimtis: 63 p. teksto, 1 priedas, 23 iliustr., 44 lent., 16 bibliografinių šaltinių.
In this master thesis Lithuanian spoken language database creation and voice codec's quality investigation is discussed. Similar speech databases are reviewed. Requirements for Lithuanian spoken language database are determined with reference to often used words and average length of sentence in Lithuanian language researches. AMR and Speex voice codec's coding quality are made operating Lithuanian and ITU- T P.50 recommendation's appendix spoken language speech databases. Codec's quality is measured using PESQ algorithm and MOS evaluating method. 16 speakers, 8 women and 8 men were involved in recording of spoken language database. Propriety of database was tested using 3SQM algorithm according to ITU- T P.563 recommendation. The results obtained are compared with records of other languages. Using created Lithuanian spoken language and ITU- T P.50 recommendation appendix speech records databases records AMR and Speex voice codec coding quality assessments are made. Codecs quality is evaluating by PESQ algorithm, according to ITU-T Recommendation P.862 and audience listening according to ITU T recommendation P.800. Quality evaluation results are presented in MOS scale. At the end of thesis the conclusions are formulated.Structure: 7 chapters, introduction, speech databases overview, creation of sentences for recording database, evaluation of speech codec's, conclusions, references, appendix. Thesis consists of: 63 p. texts, 1 appendix, 23 pictures, 44 tables, 16 bibliographical entries.