Evaluating Segment Anything Model for segmentation of camouflaged animals
Aukee, Tatu (2026)
Kandidaatintyö
Aukee, Tatu
2026
School of Engineering Science, Laskennallinen tekniikka
Julkaisun pysyvä osoite on
https://urn.fi/URN:NBN:fi-fe20260824119725
https://urn.fi/URN:NBN:fi-fe20260824119725
Tiivistelmä
The widespread adoption of camera traps in wildlife imagery collection has resulted in a surge of unfiltered image data. The continuous growth in generated data is starting to outpace the capability to process it manually, highlighting the need for automated methods for refining wildlife data for expert use. These methods need to be robust to challenges posed by automated image collection, including image defects and the camouflage exhibited by wildlife.
The segmentation capability of Meta's Segment Anything Model 3 on wildlife imagery is evaluated in this thesis. For this purpose, two datasets are used: COD10K for evaluating the model's performance on camouflaged animals and SealID for evaluating performance on camera trap imagery of single species. Mean Intersection over Union (mIoU) is used as the main evaluation metric for both datasets. In evaluation on COD10K, SAM3 was found to perform the best at Confidence threshold of CT = 0.5 with mIoU of 0.599. For the evaluation on SealID, the model's best performance was at CT = 0.7 with mIoU of 0.927.
A preliminary visual image-level analysis on SAM3's inference results was also performed to investigate the potential effects of animal camouflage and image defects on segmentation quality. Confusion of prompted concept with unrelated background objects was identified as the most common failure mode in segmentation at lower confidence thresholds. This failure mode was encountered more often in the camouflage-oriented COD10K dataset. Riistakameroiden laaja käyttöönotto villieläinkuvien hankkimisessa on saanut käsittelemättömän kuvadatan määrän huomattavaan kasvuun. Olemassaolevilla resursseilla ei kyetä vastaamaan täysin saatavilla oleviin datamääriin, joten automatisoituja menetelmiä kuvien jatkojalostukseen on kehitettävä. Luontokuvien läpikäymiseen tarkoitetun automaattisen menetelmän täytyy kuitenkin kyetä vaivatta selättämään alan tehtäväkohtaiset haasteet, kuten kuvavirheet ja eläinten luontainen naamioitumiskyky.
Tässä työssä arvioidaan Metan Segment Anything Model 3:n suorituskykyä. Suorituskyvyn arvioimiseen käytetään kahta eri aineistoa; COD10K-aineistolla arvioidaan SAM3:a naamioituneiden eläinten segmentoinnissa, ja SealID-aineistolla mallia arvioidaan riistakamerakuvien segmentoinnissa. Suorituskykyä mitataan keskimääräisellä Jaccard-indeksillä (mean Intersection over Union, mIoU). COD10K-aineistolla SAM3:n suorituskyvyn havaittiin olevan parhaimmillaan mallin varmuusarvon (Confidence Threshold, CT) ollessa CT = 0.5, jolloin mIoU:n arvoksi saatiin mIoU = 0.599. SealID-aineistolla parhaimman varmuusarvon havaittiin olevan CT = 0.7, jolloin mIoU:n arvoksi saatiin mIoU = 0.927.
Suorituskyvyn numeerisen arvioinnin lisäksi SAM3:n päättelyn tuloksia arvioitiin visuaalisesti eläimien naamioiden mahdollisten segmentointilaatuun vaikuttavien tekijöiden tunnistamiseksi. Yleisin laatuun vaikuttava tekijä havaittiin olevan käytetyn segmentointimallin sekaantuminen annetun kehotteen ja sen kohteena olevan taustassa olevien, kehotteeseen liittymättömien kohteiden välillä. Tämän ilmiön havaittiin olevan yleisempi juuri naamiointipainotteisen COD10K-aineiston yhteydessä.
The segmentation capability of Meta's Segment Anything Model 3 on wildlife imagery is evaluated in this thesis. For this purpose, two datasets are used: COD10K for evaluating the model's performance on camouflaged animals and SealID for evaluating performance on camera trap imagery of single species. Mean Intersection over Union (mIoU) is used as the main evaluation metric for both datasets. In evaluation on COD10K, SAM3 was found to perform the best at Confidence threshold of CT = 0.5 with mIoU of 0.599. For the evaluation on SealID, the model's best performance was at CT = 0.7 with mIoU of 0.927.
A preliminary visual image-level analysis on SAM3's inference results was also performed to investigate the potential effects of animal camouflage and image defects on segmentation quality. Confusion of prompted concept with unrelated background objects was identified as the most common failure mode in segmentation at lower confidence thresholds. This failure mode was encountered more often in the camouflage-oriented COD10K dataset.
Tässä työssä arvioidaan Metan Segment Anything Model 3:n suorituskykyä. Suorituskyvyn arvioimiseen käytetään kahta eri aineistoa; COD10K-aineistolla arvioidaan SAM3:a naamioituneiden eläinten segmentoinnissa, ja SealID-aineistolla mallia arvioidaan riistakamerakuvien segmentoinnissa. Suorituskykyä mitataan keskimääräisellä Jaccard-indeksillä (mean Intersection over Union, mIoU). COD10K-aineistolla SAM3:n suorituskyvyn havaittiin olevan parhaimmillaan mallin varmuusarvon (Confidence Threshold, CT) ollessa CT = 0.5, jolloin mIoU:n arvoksi saatiin mIoU = 0.599. SealID-aineistolla parhaimman varmuusarvon havaittiin olevan CT = 0.7, jolloin mIoU:n arvoksi saatiin mIoU = 0.927.
Suorituskyvyn numeerisen arvioinnin lisäksi SAM3:n päättelyn tuloksia arvioitiin visuaalisesti eläimien naamioiden mahdollisten segmentointilaatuun vaikuttavien tekijöiden tunnistamiseksi. Yleisin laatuun vaikuttava tekijä havaittiin olevan käytetyn segmentointimallin sekaantuminen annetun kehotteen ja sen kohteena olevan taustassa olevien, kehotteeseen liittymättömien kohteiden välillä. Tämän ilmiön havaittiin olevan yleisempi juuri naamiointipainotteisen COD10K-aineiston yhteydessä.
