Hyppää sisältöön
    • Suomeksi
    • På svenska
    • In English
  • Suomeksi
  • In English
  • Kirjaudu
Näytä aineisto 
  •   Etusivu
  • LUTPub
  • Kandidaatin tutkintojen opinnäytetyöt
  • Näytä aineisto
  •   Etusivu
  • LUTPub
  • Kandidaatin tutkintojen opinnäytetyöt
  • Näytä aineisto
JavaScript is disabled for your browser. Some features of this site may not work without it.

Keskustelusta kuvaksi : reaaliaikaisen keskustelun muuntaminen tekoälytaiteeksi

Terhiä, Paulo (2025)

Katso/Avaa
Kandidaatintyo_Terhia_Paulo.pdf (1.459Mb)
Lataukset: 


Kandidaatintyö

Terhiä, Paulo
2025

School of Engineering Science, Tietotekniikka

Kaikki oikeudet pidätetään.
Näytä kaikki kuvailutiedot
Julkaisun pysyvä osoite on
https://urn.fi/URN:NBN:fi-fe20251208115844

Tiivistelmä

Generatiivisen tekoälyn kyvykkyys on kasvanut nopeasti sekä tekstin että kuvien tuottamisessa. Tässä työssä esitellään puheesta kuvaan -järjestelmä, joka yhdistää striimaavan puheentunnistuksen, neurokonekäännöksen ja generatiivisen kuvamallin yhtenäiseksi prosessiksi. Tavoitteena on tutkia olemassa olevien mallien toimivuutta kuluttajalaitteistolla, keskittyen erityisesti suomenkieliseen käyttöön.

Järjestelmä on toteutettu paikallisesti ajettavalla ohjelmistolla, välttäen ulkoisia palveluita. Työssä tarkastellaan kuinka tarkasti järjestelmä voi tunnistaa suomenkielistä puhetta ja generoida siitä kuvasarja. Lopputulosta arvioidaan sekä suorituskyvyn että kuvasarjan yhtenäisyyden ja semanttisen tarkkuuden kannalta. Järjestelmän tuottamia kuvasarjoja verrataan ulkoisten palveluiden avustamiin kuvasarjoihin.

Tulokset osoittavat, että järjestelmä on parhaillaan yksittäisen kuvan generoinnissa. Järjestelmä on suorituskyvyllisesti tehokas ja tuotettu kuva vastaa puheenaihetta. Kuvasarjan tuottamisessa järjestelmä osoittaa heikkoutta kuvien temaattisessa yhtenäisyydessä, mutta ulkoisten palveluiden avustamana kuvasarja saadaan tuotettua yhtenäisenä kokonaisuutena. Järjestelmä soveltuu hyvin yksittäisen kuvan tuottamiseen, mutta kuvasarjaa varten vaaditaan ulkoisen palvelun avustusta.
 
The capabilities of generative artificial intelligence have grown rapidly in both text and image generation. This thesis presents a speech-to-image system that combines streaming speech recognition, neural machine translation, and a generative image model into one unified process. The aim is to examine how well existing models function on consumer hardware, with a particular focus on Finnish-language use.

The system is implemented as locally executed software, avoiding external services. The thesis investigates how accurately the system can recognize Finnish speech and generate an image sequence based on it. The outcome is evaluated in terms of computational performance as well as the cohesion and semantic accuracy of the resulting image sequence. The image sequences produced by the system are compared with sequences generated with the assistance of external services.

The results show that the system performs best when generating a single image. It is computationally efficient, and the produced image corresponds well to the topic of the speech. In generating image sequences, however, the system exhibits weaknesses in the thematic cohesion between images, though with the support of external services the sequence can be produced as a more consistent whole. The system is therefore well suited for producing individual images, but generating a cohesive image sequence requires assistance from an external service.
 
Kokoelmat
  • Kandidaatin tutkintojen opinnäytetyöt [7212]
LUT-yliopisto
PL 20
53851 Lappeenranta
Ota yhteyttä | Tietosuoja | Saavutettavuusseloste
 

 

Tämä kokoelma

JulkaisuajatTekijätNimekkeetKoulutusohjelmaAvainsanatSyöttöajatYhteisöt ja kokoelmat

Omat tiedot

Kirjaudu sisäänRekisteröidy
LUT-yliopisto
PL 20
53851 Lappeenranta
Ota yhteyttä | Tietosuoja | Saavutettavuusseloste