Koulutetun tekoälyn hyödyntäminen kiinteistöjen huoltotöiden automatisoinnissa : case Lappeenrannan seudun opiskelija-asuntosäätiö
Erkkilä, Valtteri (2026)
Kandidaatintyö
Erkkilä, Valtteri
2026
School of Engineering Science, Tietotekniikka
Kaikki oikeudet pidätetään.
Julkaisun pysyvä osoite on
https://urn.fi/URN:NBN:fi-fe20260824119416
https://urn.fi/URN:NBN:fi-fe20260824119416
Tiivistelmä
Tässä kandidaatintyössä tutkitaan tekoälyn hyödyntämistä kiinteistöjen vikailmoitusten automaattisessa kohdentamisessa oikealle alihankkijalle, tapaustutkimuksena Lappeenrannan seudun opiskelija-asuntosäätiö (LOAS). Työssä hienosäädettiin monikielinen XLM-RoBERTa-kielimalli luokittelemaan LOASin vikailmoitusaineisto 20 kohdeluokkaan. Koulutuksen pituus valittiin mallin ennusteiden kalibroinnin perusteella.
Lopullinen malli saavutti 38 prosentin kokonaistarkkuuden, mikä ylittää noin 21 prosentin perustason, jonka olisi saanut arvaamalla aina yleisimmän alihankkijaluokan. Osa ennusteista oli kuitenkin liian epävarmoja luotettavaan automaatioon. Mallin varmuutta hyödyntäen noin 12–19 prosenttia ilmoituksista voitiin automatisoida 67–72 prosentin tarkkuudella. Kaksi automaattista koulutuksen pysäytysmenetelmää johti ylivarmistumiseen, kun taas käsin tehty kalibrointivertailu oli luotettavampi.
Tulokset osoittavat lähestymistavan olevan teknisesti toteutettavissa myös pienellä ja epätasapainoisella aineistolla, mutta luotettavasti automatisoitavissa oleva osuus jäi vaatimattomaksi. Keskeisiä rajoitteita ovat luokkaepätasapaino ja kohdemuuttujan osittainen epätarkkuus. This bachelor's thesis examines the use of artificial intelligence in automatically assigning property fault reports to the correct subcontractor, using the Student Housing Foundation for the Region of Lappeenranta (LOAS) as a case study. A multilingual XLM-RoBERTa language model was fine-tuned to classify LOAS's fault report data into 20 target classes. Training duration was selected based on the calibration of the model's predictions.
The final model achieved 38 percent overall accuracy, exceeding the baseline of approximately 21 percent that would be achieved by always guessing the most common subcontractor class. However, some predictions were too uncertain for reliable automation. Using the model's confidence, approximately 12–19 percent of reports could be automated with 67–72 percent accuracy. Two automatic methods for determining training length led to overconfidence, whereas a manually conducted calibration comparison was more reliable.
The results show the approach is technically feasible even with a small, imbalanced dataset, but the share of reports that could be reliably automated remained modest. Key limitations are class imbalance and partial inaccuracy in the target variable.
Lopullinen malli saavutti 38 prosentin kokonaistarkkuuden, mikä ylittää noin 21 prosentin perustason, jonka olisi saanut arvaamalla aina yleisimmän alihankkijaluokan. Osa ennusteista oli kuitenkin liian epävarmoja luotettavaan automaatioon. Mallin varmuutta hyödyntäen noin 12–19 prosenttia ilmoituksista voitiin automatisoida 67–72 prosentin tarkkuudella. Kaksi automaattista koulutuksen pysäytysmenetelmää johti ylivarmistumiseen, kun taas käsin tehty kalibrointivertailu oli luotettavampi.
Tulokset osoittavat lähestymistavan olevan teknisesti toteutettavissa myös pienellä ja epätasapainoisella aineistolla, mutta luotettavasti automatisoitavissa oleva osuus jäi vaatimattomaksi. Keskeisiä rajoitteita ovat luokkaepätasapaino ja kohdemuuttujan osittainen epätarkkuus.
The final model achieved 38 percent overall accuracy, exceeding the baseline of approximately 21 percent that would be achieved by always guessing the most common subcontractor class. However, some predictions were too uncertain for reliable automation. Using the model's confidence, approximately 12–19 percent of reports could be automated with 67–72 percent accuracy. Two automatic methods for determining training length led to overconfidence, whereas a manually conducted calibration comparison was more reliable.
The results show the approach is technically feasible even with a small, imbalanced dataset, but the share of reports that could be reliably automated remained modest. Key limitations are class imbalance and partial inaccuracy in the target variable.
