Real-time speech-to-speech translation systems : optimizing latency and accuracy for live communication
Babar, Salman (2026)
Kandidaatintyö
Babar, Salman
2026
School of Engineering Science, Tietotekniikka
Kaikki oikeudet pidätetään.
Julkaisun pysyvä osoite on
https://urn.fi/URN:NBN:fi-fe20260723112146
https://urn.fi/URN:NBN:fi-fe20260723112146
Tiivistelmä
This thesis explores the design and optimization of real-time speech-to-speech (S2S) translation systems that enable seamless multilingual communication in live environments such as video calls, streaming platforms, and conferences. The aim is to examine how existing translation pipelines - composed of automatic speech recognition (ASR), neural machine translation (NMT), and text-to-speech (TTS) modules – can be improved to achieve lower latency and higher translation quality.
The study reviews the current state of S2S systems and evaluates the performance of opensource and commercial models. It identifies major challenges in real-time translation, including delay accumulation, synchronization, and loss of contextual meaning. Through a prototype implementation and comparative testing, the thesis investigates practical methods for reducing system latency without compromising translation accuracy or naturalness of the output speech.
The results aim to contribute to ongoing research on efficient and human-like speech translation. By analyzing existing architectures and testing streamlined model combinations, this work proposes improvements for integrating real-time translation systems into modern communication tools, ultimately enhancing accessibility and cross-lingual understanding in global interactions. Tässä kandidaatintyössä tarkastellaan reaaliaikaisten puheesta puheeseen (Speech-toSpeech, S2S) -käännösjärjestelmien suunnittelua ja optimointia. Tavoitteena on mahdollistaa sujuva monikielinen viestintä reaaliaikaisissa ympäristöissä, kuten videopuheluissa, suoratoistoalustoilla ja konferensseissa. Työssä tutkitaan, kuinka nykyisiä käännösputkia, jotka koostuvat automaattisesta puheentunnistuksesta (ASR), neuroverkkopohjaisesta konekääntämisestä (NMT) sekä tekstistä puheeksi -moduuleista (TTS), voidaan kehittää viiveen vähentämiseksi ja käännösten laadun parantamiseksi.
Tutkimuksessa tarkastellaan puheesta puheeseen -käännösjärjestelmien nykytilaa sekä arvioidaan avoimen lähdekoodin ja kaupallisten mallien suorituskykyä. Työssä tunnistetaan reaaliaikaisen puheenkäännöksen keskeisiä haasteita, kuten viiveen kasautuminen, synkronointi sekä asiayhteyden merkityksen heikkeneminen. Prototyyppitoteutuksen ja vertailevan testauksen avulla tutkitaan käytännön menetelmiä järjestelmän viiveen pienentämiseksi ilman, että käännösten tarkkuus tai tuotetun puheen luonnollisuus kärsii.
Työn tulokset tukevat tehokkaiden ja ihmismäisten puheenkäännösjärjestelmien kehittämistä koskevaa tutkimusta. Analysoimalla olemassa olevia arkkitehtuureja ja testaamalla virtaviivaistettuja malliyhdistelmiä työ esittää parannusehdotuksia reaaliaikaisten käännösjärjestelmien integroimiseksi nykyaikaisiin viestintävälineisiin. Näin voidaan edistää saavutettavuutta ja eri kieliä puhuvien käyttäjien välistä ymmärrystä maailmanlaajuisessa viestinnässä.
The study reviews the current state of S2S systems and evaluates the performance of opensource and commercial models. It identifies major challenges in real-time translation, including delay accumulation, synchronization, and loss of contextual meaning. Through a prototype implementation and comparative testing, the thesis investigates practical methods for reducing system latency without compromising translation accuracy or naturalness of the output speech.
The results aim to contribute to ongoing research on efficient and human-like speech translation. By analyzing existing architectures and testing streamlined model combinations, this work proposes improvements for integrating real-time translation systems into modern communication tools, ultimately enhancing accessibility and cross-lingual understanding in global interactions.
Tutkimuksessa tarkastellaan puheesta puheeseen -käännösjärjestelmien nykytilaa sekä arvioidaan avoimen lähdekoodin ja kaupallisten mallien suorituskykyä. Työssä tunnistetaan reaaliaikaisen puheenkäännöksen keskeisiä haasteita, kuten viiveen kasautuminen, synkronointi sekä asiayhteyden merkityksen heikkeneminen. Prototyyppitoteutuksen ja vertailevan testauksen avulla tutkitaan käytännön menetelmiä järjestelmän viiveen pienentämiseksi ilman, että käännösten tarkkuus tai tuotetun puheen luonnollisuus kärsii.
Työn tulokset tukevat tehokkaiden ja ihmismäisten puheenkäännösjärjestelmien kehittämistä koskevaa tutkimusta. Analysoimalla olemassa olevia arkkitehtuureja ja testaamalla virtaviivaistettuja malliyhdistelmiä työ esittää parannusehdotuksia reaaliaikaisten käännösjärjestelmien integroimiseksi nykyaikaisiin viestintävälineisiin. Näin voidaan edistää saavutettavuutta ja eri kieliä puhuvien käyttäjien välistä ymmärrystä maailmanlaajuisessa viestinnässä.
Kokoelmat
Samankaltainen aineisto
Näytetään aineisto, joilla on samankaltaisia nimekkeitä, tekijöitä tai asiasanoja.
-
ÄÄNEEN PERUSTUVA KÄYTTÄJÄN TODENTAMINEN PUHELINVERKON LISÄARVOPALVELUISSA
Lötjönen, Mika (2001)Tässä diplomityössä perehdytään puhujantunnistukseen ja sen käyttökelpoisuuteen käyttäjän henkilöllisyyden todentamisessa osana puhelinverkon lisäarvopalveluja. Puhelimitse ohjattavat palvelut ovat yleensä perustuneet ... -
Yritysvalmennuksen onnistumiset ja kehittämiskohteet Case: Start-up & Spin-off Factory -projekti
Virtanen, Arto (2015)Tässä työssä tarkastellaan Start-up & Spin-off Factory -projektissa, pääsääntöisesti Kymenlaaksossa toimiville, yrittäjille suunnattua ja toteutettua yritysvalmennusohjelmaa. Työssä selvitetään ja käsitellään Start-up & ... -
Transcribing services and text analysis
Kiviharju, Timo (2019)The goal for this project is to analyze how to successfully transcribe phone calls in English and Finnish by using transcript services, and how to store the resulting data so that it can be used in computer analysis. In ...


