A comparative benchmark for issue report classification in open-source software
Janhunen, Simo (2026)
Diplomityö
Janhunen, Simo
2026
School of Engineering Science, Tietotekniikka
Kaikki oikeudet pidätetään.
Julkaisun pysyvä osoite on
https://urn.fi/URN:NBN:fi-fe2026060764781
https://urn.fi/URN:NBN:fi-fe2026060764781
Tiivistelmä
Issue tracking systems in open-source software projects contain large amounts of textual data that needs to be structured to be useful, the amount of data makes it so that their manual classification becomes cumbersome as the projects grow. This thesis studies automated multiclass issue report classification in open-source software and compares three model families under the same experimental setup to establish a comparable benchmark across the same datasets. The three model families used are a neural network model (GCN), a transformer-based pre-trained language model (RoBERTa), and a decoder-based large language model (Mistral 7B).
The models were evaluated on three different multiclass datasets with with identical label sets. The evaluation includes accuracy as well as micro- and macro-averages for precision, recall, and F1-score. Additionally, a confusion matrix analysis is performed and training times are compared.
RoBERTa produced the strongest and most stable performance across the studied datasets. GCN followed with lower performance but still within competitive range. Mistral 7B performed weakest in zero-shot mode, while fine-tuning improved results clearly but did not fully close the gap to other models. Across all models, class-wise performance was less uniform than overall accuracy suggests, especially on smaller datasets where minority-class recall dropped first. Avoimen lähdekoodin projektien tehtävienhallintajärjestelmät sisältävät suuria määriä vapaamuotoista tekstiä joka tulisi järjestellä ollakseen hyödyllistä, tekstin suuri määrä johtaa siihen että tehtäväraporttien manuaalinen luokittelu vaikeutuu projektien kasvaessa. Tässä työssä tarkastellaan avoimen lähdekoodin projektien tehtäväraporttien moniluokkaluokittelua ja verrataan kolmea eri malliperhettä samassa koeasetelmassa jotta saavutetaan vertailukelpoisia tuloksia käyttäen samoja aineistoja. Tutkitut kolme malliperhettä ovat graafikonvoluutioverkot (GCN), esikoulutetut transformer-mallit (RoBERTa) ja dekooderipohjaiset suuret kielimallit (Mistral 7B).
Mallit arvioitiin kolmella eri moniluokka-aineistolla joissa oli identtiset luokat. Arviointi sisältää tarkkuuden sekä mikro- ja makrokeskiarvoistetut todelliset positiivistet tulokset, virheelliset positiiviset tulokset sekä F1-pisteet. Lisäksi tuloksia tulkittiin sekaannusmatriisien sekä mallien koulutusajan perusteella.
RoBERTa saavutti parhaat ja tasaisimmat tulokset kaikilla tutkituilla aineistoilla. GCN:n suorituminen oli hieman heikompi, mutta suoriutui kuitenkin edelleen kilpailukykyisesti. Mistral 7B:n ilman hienosäätöä saadut tulokset olivat kaikista heikoimmat. Hienosäätäminen paransi Mistral 7B:n tuloksia selvästi, mutta ei kuitenkaan nostanut mallia muiden tutkittujen mallien tasolle. Tulokset osoittivat että luokkakohtainen suorituskyky on selvästi epätasaisempi kuin pelkkä tarkkuus antaisi ymmärtää, tämä näkyy selkeimmin varsinkin pienemmissä aineistoissa.
The models were evaluated on three different multiclass datasets with with identical label sets. The evaluation includes accuracy as well as micro- and macro-averages for precision, recall, and F1-score. Additionally, a confusion matrix analysis is performed and training times are compared.
RoBERTa produced the strongest and most stable performance across the studied datasets. GCN followed with lower performance but still within competitive range. Mistral 7B performed weakest in zero-shot mode, while fine-tuning improved results clearly but did not fully close the gap to other models. Across all models, class-wise performance was less uniform than overall accuracy suggests, especially on smaller datasets where minority-class recall dropped first.
Mallit arvioitiin kolmella eri moniluokka-aineistolla joissa oli identtiset luokat. Arviointi sisältää tarkkuuden sekä mikro- ja makrokeskiarvoistetut todelliset positiivistet tulokset, virheelliset positiiviset tulokset sekä F1-pisteet. Lisäksi tuloksia tulkittiin sekaannusmatriisien sekä mallien koulutusajan perusteella.
RoBERTa saavutti parhaat ja tasaisimmat tulokset kaikilla tutkituilla aineistoilla. GCN:n suorituminen oli hieman heikompi, mutta suoriutui kuitenkin edelleen kilpailukykyisesti. Mistral 7B:n ilman hienosäätöä saadut tulokset olivat kaikista heikoimmat. Hienosäätäminen paransi Mistral 7B:n tuloksia selvästi, mutta ei kuitenkaan nostanut mallia muiden tutkittujen mallien tasolle. Tulokset osoittivat että luokkakohtainen suorituskyky on selvästi epätasaisempi kuin pelkkä tarkkuus antaisi ymmärtää, tämä näkyy selkeimmin varsinkin pienemmissä aineistoissa.
