Hyppää sisältöön
    • Suomeksi
    • På svenska
    • In English
  • Suomeksi
  • In English
  • Kirjaudu
Näytä aineisto 
  •   Etusivu
  • LUTPub
  • Diplomityöt ja Pro gradu -tutkielmat
  • Näytä aineisto
  •   Etusivu
  • LUTPub
  • Diplomityöt ja Pro gradu -tutkielmat
  • Näytä aineisto
JavaScript is disabled for your browser. Some features of this site may not work without it.

Can AI judge AI? : designing and building an automated LLM evaluation platform for enterprise generative AI systems

Lipponen, Jaakko (2026)

Katso/Avaa
Diplomityo_Lipponen_Jaakko.pdf (1.295Mb)
Lataukset: 


Diplomityö

Lipponen, Jaakko
2026

School of Engineering Science, Tietotekniikka

Kaikki oikeudet pidätetään.
Näytä kaikki kuvailutiedot
Julkaisun pysyvä osoite on
https://urn.fi/URN:NBN:fi-fe20260629105370

Tiivistelmä

This thesis investigates whether small and mid-size large language models can be used as automated judges for evaluating outputs from Telia's RAG-enabled LLM systems in an enterprise setting. The work follows a design science research approach and presents an event-driven evaluation microservice that consumes AI interaction events, filters and claims them idempotently, runs configurable DeepEval-based metrics, and persists structured evaluation results.

A software artefact is evaluated using 27 fixtures, five quality metrics, and four productionviable judge models across three repeated runs, with all scored judges achieving high parseable-output reliability by completing at least 96.3% of fixture evaluations. Agreement with a single informed reference rater was moderate at about 76.8% to 80.8% for all four judges. Self-consistency was the main limitation: the 2B judge was unstable across repeated runs, while the effective-4B and larger judges were substantially more stable. The findings support automated LLM-as-a-judge evaluation as a scalable quality monitoring signal rather than a replacement for calibrated human judgement and confirm that the artefact satisfies its core functional and non-functional requirements for enterprise deployment.
 
Tässä diplomityössä tutkitaan, voidaanko pieniä ja keskisuuria suuria kielimalleja käyttää automaattisina arvioijina Telian RAG-pohjaisten LLM-järjestelmien vastausten arvioinnissa yritysympäristössä. Työ noudattaa suunnittelutieteellistä tutkimusotetta ja esittelee tapahtumapohjaisen arviointimikropalvelun, joka vastaanottaa tekoälyn vuorovaikutustapahtumia, suodattaa ja varaa ne idempotentisti, suorittaa konfiguroitavia DeepEval-pohjaisia metriikoita ja tallentaa arviointitulokset rakenteisessa muodossa.

Arviointia varten toteutetaan ohjelmistoartefakti, jossa käytetään 27 arviointitapausta, viittä laatumetriikkaa ja neljää tuotantokelpoista arvioijamallia kolmessa toistetussa ajossa. Kaikki pisteytetyt arvioijamallit saavuttivat korkean jäsennettävän tulosteen luotettavuuden ja suorittivat vähintään 96,3% arviointitapauksista loppuun. Yhden asiantuntevan viitearvioijan kanssa mitattu yhdenmukaisuus oli kohtalainen kaikilla neljällä arvioijamallilla, vaihdellen 76,8% ja 80,8% välillä. Keskeinen rajoite oli itseyhdenmukaisuus: 2B-parametrin arvioijamalli oli epävakaa toistetuissa ajoissa, kun taas efektiivinen 4B-malli ja sitä suuremmat arvioijamallit olivat selvästi vakaampia. Tulokset tukevat automaattista LLM-arviointia skaalautuvana laadun seurantasignaalina kalibroidun ihmisarvioinnin korvaajan sijaan ja vahvistavat, että artefakti täyttää keskeiset toiminnalliset ja ei-toiminnalliset vaatimukset yritystason käyttöönottoa varten.
 
Kokoelmat
  • Diplomityöt ja Pro gradu -tutkielmat [15472]
LUT-yliopisto
PL 20
53851 Lappeenranta
Ota yhteyttä | Tietosuoja | Saavutettavuusseloste
 

 

Tämä kokoelma

JulkaisuajatTekijätNimekkeetKoulutusohjelmaAvainsanatSyöttöajatYhteisöt ja kokoelmat

Omat tiedot

Kirjaudu sisäänRekisteröidy
LUT-yliopisto
PL 20
53851 Lappeenranta
Ota yhteyttä | Tietosuoja | Saavutettavuusseloste