Keskustelusta kuvaksi : reaaliaikaisen keskustelun muuntaminen tekoälytaiteeksi
Terhiä, Paulo (2025)
Kandidaatintyö
Terhiä, Paulo
2025
School of Engineering Science, Tietotekniikka
Kaikki oikeudet pidätetään.
Julkaisun pysyvä osoite on
https://urn.fi/URN:NBN:fi-fe20251208115844
https://urn.fi/URN:NBN:fi-fe20251208115844
Tiivistelmä
Generatiivisen tekoälyn kyvykkyys on kasvanut nopeasti sekä tekstin että kuvien tuottamisessa. Tässä työssä esitellään puheesta kuvaan -järjestelmä, joka yhdistää striimaavan puheentunnistuksen, neurokonekäännöksen ja generatiivisen kuvamallin yhtenäiseksi prosessiksi. Tavoitteena on tutkia olemassa olevien mallien toimivuutta kuluttajalaitteistolla, keskittyen erityisesti suomenkieliseen käyttöön.
Järjestelmä on toteutettu paikallisesti ajettavalla ohjelmistolla, välttäen ulkoisia palveluita. Työssä tarkastellaan kuinka tarkasti järjestelmä voi tunnistaa suomenkielistä puhetta ja generoida siitä kuvasarja. Lopputulosta arvioidaan sekä suorituskyvyn että kuvasarjan yhtenäisyyden ja semanttisen tarkkuuden kannalta. Järjestelmän tuottamia kuvasarjoja verrataan ulkoisten palveluiden avustamiin kuvasarjoihin.
Tulokset osoittavat, että järjestelmä on parhaillaan yksittäisen kuvan generoinnissa. Järjestelmä on suorituskyvyllisesti tehokas ja tuotettu kuva vastaa puheenaihetta. Kuvasarjan tuottamisessa järjestelmä osoittaa heikkoutta kuvien temaattisessa yhtenäisyydessä, mutta ulkoisten palveluiden avustamana kuvasarja saadaan tuotettua yhtenäisenä kokonaisuutena. Järjestelmä soveltuu hyvin yksittäisen kuvan tuottamiseen, mutta kuvasarjaa varten vaaditaan ulkoisen palvelun avustusta. The capabilities of generative artificial intelligence have grown rapidly in both text and image generation. This thesis presents a speech-to-image system that combines streaming speech recognition, neural machine translation, and a generative image model into one unified process. The aim is to examine how well existing models function on consumer hardware, with a particular focus on Finnish-language use.
The system is implemented as locally executed software, avoiding external services. The thesis investigates how accurately the system can recognize Finnish speech and generate an image sequence based on it. The outcome is evaluated in terms of computational performance as well as the cohesion and semantic accuracy of the resulting image sequence. The image sequences produced by the system are compared with sequences generated with the assistance of external services.
The results show that the system performs best when generating a single image. It is computationally efficient, and the produced image corresponds well to the topic of the speech. In generating image sequences, however, the system exhibits weaknesses in the thematic cohesion between images, though with the support of external services the sequence can be produced as a more consistent whole. The system is therefore well suited for producing individual images, but generating a cohesive image sequence requires assistance from an external service.
Järjestelmä on toteutettu paikallisesti ajettavalla ohjelmistolla, välttäen ulkoisia palveluita. Työssä tarkastellaan kuinka tarkasti järjestelmä voi tunnistaa suomenkielistä puhetta ja generoida siitä kuvasarja. Lopputulosta arvioidaan sekä suorituskyvyn että kuvasarjan yhtenäisyyden ja semanttisen tarkkuuden kannalta. Järjestelmän tuottamia kuvasarjoja verrataan ulkoisten palveluiden avustamiin kuvasarjoihin.
Tulokset osoittavat, että järjestelmä on parhaillaan yksittäisen kuvan generoinnissa. Järjestelmä on suorituskyvyllisesti tehokas ja tuotettu kuva vastaa puheenaihetta. Kuvasarjan tuottamisessa järjestelmä osoittaa heikkoutta kuvien temaattisessa yhtenäisyydessä, mutta ulkoisten palveluiden avustamana kuvasarja saadaan tuotettua yhtenäisenä kokonaisuutena. Järjestelmä soveltuu hyvin yksittäisen kuvan tuottamiseen, mutta kuvasarjaa varten vaaditaan ulkoisen palvelun avustusta.
The system is implemented as locally executed software, avoiding external services. The thesis investigates how accurately the system can recognize Finnish speech and generate an image sequence based on it. The outcome is evaluated in terms of computational performance as well as the cohesion and semantic accuracy of the resulting image sequence. The image sequences produced by the system are compared with sequences generated with the assistance of external services.
The results show that the system performs best when generating a single image. It is computationally efficient, and the produced image corresponds well to the topic of the speech. In generating image sequences, however, the system exhibits weaknesses in the thematic cohesion between images, though with the support of external services the sequence can be produced as a more consistent whole. The system is therefore well suited for producing individual images, but generating a cohesive image sequence requires assistance from an external service.
