Hyppää sisältöön
    • Suomeksi
    • På svenska
    • In English
  • Suomeksi
  • In English
  • Kirjaudu
Näytä aineisto 
  •   Etusivu
  • LUTPub
  • Diplomityöt ja Pro gradu -tutkielmat
  • Näytä aineisto
  •   Etusivu
  • LUTPub
  • Diplomityöt ja Pro gradu -tutkielmat
  • Näytä aineisto
JavaScript is disabled for your browser. Some features of this site may not work without it.

LLM-based code generation : a systematic mapping study

Jortikka, Roope (2026)

Katso/Avaa
Jortikka_Roope_Masters thesis.pdf (4.619Mb)
Lataukset: 


Diplomityö

Jortikka, Roope
2026

School of Engineering Science, Tietotekniikka

Kaikki oikeudet pidätetään.
Näytä kaikki kuvailutiedot
Julkaisun pysyvä osoite on
https://urn.fi/URN:NBN:fi-fe20260720111861

Tiivistelmä

Large language models (LLMs) have rapidly become part of everyday software development, yet the research literature on LLM-based code generation has grown too quickly and too broadly to be easily understood as a whole. Dedicated reviews of individual sub-tasks exist, but few studies synthesise the whole area.

This thesis addresses that gap through a systematic mapping study, following the method of Petersen et al., of 613 primary studies published between 2023 and early 2026. Each study was characterised against a structured extraction scheme using a hybrid procedure that combined automated processing with LLM-assisted classification under manual verification, and six research questions addressed the field's tasks, evaluation practices, the pairing of challenges with solutions, their evolution over time, the extent of industrial engagement, and the least-addressed gaps.

The field is concentrated on generating correct code and measuring whether it works: functional correctness is assessed in 81.6 % of studies, and the OpenAI GPT family appears in 78.3 %. Evaluation rests on a narrow base dominated by two 2021 Python benchmarks, HumanEval and MBPP, that are widely treated as contamination-prone, while only about 7 % of studies guard against contamination. Output is concentrated on Python at 68.5 %, and genuine workplace deployment is reported by only 0.3 % of the corpus.
 
Suuret kielimallit (LLM:t) ovat nopeasti tulleet osaksi jokapäiväistä ohjelmistokehitystä, mutta LLM-pohjaista koodingenerointia käsittelevä tutkimuskirjallisuus on kasvanut liian nopeasti ja laajasti, jotta sitä olisi helppo hahmottaa kokonaisuutena. Yksittäisiä osatehtäviä käsitteleviä katsauksia on olemassa, mutta harva tutkimus tarkastelee koko aluetta kokonaisuutena.

Tämä työ vastaa tähän puutteeseen systemaattisen kartoitustutkimuksen avulla, joka noudattaa Petersenin ym. menetelmää ja kattaa 613 vuosina 2023–2026 julkaistua primaaritutkimusta. Jokainen tutkimus luokiteltiin jäsennellyn poimintakehikon mukaisesti hybridimenetelmällä, jossa yhdistettiin automaattinen käsittely ja kielimalliavusteinen luokittelu manuaalisen varmennuksen alaisena. Kuusi tutkimuskysymystä käsittelevät alan tehtäviä, arviointikäytäntöjä, haasteiden ja ratkaisujen yhdistämistä, niiden kehittymistä ajan myötä, todellisen teollisen soveltamisen laajuutta sekä vähiten käsiteltyjä tutkimusaukkoja.

Ala keskittyy oikean koodin generointiin ja sen toimivuuden mittaamiseen: toiminnallista oikeellisuutta arvioidaan 81,6 %:ssa tutkimuksista, ja OpenAI:n GPT-malliperhe esiintyy 78,3 %:ssa. Arviointi nojaa kapeaan perustaan, jota hallitsevat kaksi vuoden 2021 Python-vertailuaineistoa, HumanEval ja MBPP, joita pidetään laajalti kontaminaatiolle alttiina, ja vain noin 7 % tutkimuksista varautuu kontaminaatioon. Tuotos on keskittynyt Pythoniin 68,5 %:n osuudella, ja todellista työpaikkakäyttöönottoa raportoidaan vain 0,3 %:ssa aineistosta.
 
Kokoelmat
  • Diplomityöt ja Pro gradu -tutkielmat [15517]
LUT-yliopisto
PL 20
53851 Lappeenranta
Ota yhteyttä | Tietosuoja | Saavutettavuusseloste
 

 

Tämä kokoelma

JulkaisuajatTekijätNimekkeetKoulutusohjelmaAvainsanatSyöttöajatYhteisöt ja kokoelmat

Omat tiedot

Kirjaudu sisäänRekisteröidy
LUT-yliopisto
PL 20
53851 Lappeenranta
Ota yhteyttä | Tietosuoja | Saavutettavuusseloste