Nuotraukų generavimas pagal tekstinį aprašymą
Ramanauskaitė, Simona | Recenzentas / Rewiewer |
Darbo gynimo komisijos pirmininkas / Thesis Defence Board Chairman | |
Darbo gynimo komisijos narys / Thesis Defence Board Member | |
Darbo gynimo komisijos narys / Thesis Defence Board Member | |
Medvedev, Viktor | Darbo gynimo komisijos narys / Thesis Defence Board Member |
Darbo gynimo komisijos narys / Thesis Defence Board Member | |
Darbo gynimo komisijos narys / Thesis Defence Board Member | |
Darbo gynimo komisijos narys / Thesis Defence Board Member |
Šiame magistro darbe nagrinėtas nuotraukų generavimo pagal tekstinį aprašymą klausimas, atliekant išsamią literatūros analizę bei praktinius eksperimentus su įvairiais šiuolaikiniais modeliais. Pagrindinis darbo tikslas buvo palyginti skirtingus generatyvinius metodus ir įvertinti jų efektyvumą pagal rezultatų kokybę ir mokymo aibės dydį. Literatūros apžvalgoje aptarti pagrindiniai metodai - difuziniai modeliai, generatyviniai konkuruojantys tinklai (GAN) ir auto regresyviniai transformatoriai - bei pagrindiniai jų pranašumai ir trūkumai. Tyrimas atskleidė, kad difuziniai modeliai dažnai pasižymi aukštesne sugeneruotų vaizdų kokybe, ypač kai naudojami kartu su pažangiais tekstinio aprašymo analizės modeliais, tokiais kaip CLIP ar BERT. Praktinėje dalyje buvo išbandyti skirtingi viešai prieinami modeliai (pvz., DALL-E, Stable Diffusion) ir sukurta pavyzdinė sistema, papildyta nuotraukų atributų klasifikacija, siekiant pagerinti generavimo tikslumą. Eksperimentai parodė, kad naudojant papildomą duomenų paruošimą galima ženkliai pagerinti generuojamų vaizdų kokybę ir semantinį atitikimą tekstui. Atlikus tyrimą, buvo padaryta išvada, kad aukštos kokybės ir įvairiapusio vaizdų generavimo pasiekimui būtinas pažangių teksto apdorojimo, mokymo duomenų optimizavimo ir generavimo procesų valdymo metodų derinys. Taip pat išskirtos pagrindinės ateities tyrimų kryptys, įskaitant multimodalinės informacijos integraciją, daugiakalbystės palaikymą bei automatizuotų kokybės vertinimo sistemų plėtrą.
This master's thesis investigates the problem of image generation based on textual descriptions, combining an extensive literature review with practical experiments on various state-of-the-art models. The main goal of the work was to compare different generative methods and evaluate their performance in terms of output quality and training dataset size. The literature review focused on key methods - diffusion models, generative adversarial networks (GANs), and autoregressive transformers - highlighting their respective advantages and limitations. The research demonstrated that diffusion models often outperform GANs in producing higher-quality images, particularly when combined with advanced text analysis models such as CLIP and BERT. In the practical section, several publicly available models (e.g., DALL-E, Stable Diffusion) were tested, and a sample system was developed, integrating an attribute classification step to enhance the accuracy of the generation process. Experimental results indicated that preprocessing input data can significantly improve both the visual quality and semantic relevance of the generated images. The findings suggest that achieving high-quality, diverse image generation requires a combination of sophisticated text interpretation techniques, optimized training data usage, and effective control over the generation process. Future research directions include multimodal input integration, support for multilingual text descriptions, and the development of automated image quality evaluation systems.