Uncertainty calibration and evaluation in deep neural networks

Laen...
Pisipilt

Kuupäev

Ajakirja pealkiri

Ajakirja ISSN

Köite pealkiri

Kirjastaja

Tartu Ülikooli Kirjastus

Abstrakt

Masinõppemudelid on laialdaselt kasutusel mitmesugustes tuvastus- ja ennustusülesannetes, näiteks objektide tuvastamiseks ja nende tulevase asukoha ennustamiseks isejuhtivates sõidukites. Samuti kasutatakse neid üha enam otsuste tegemiseks, sealhulgas valdkondades, kus otsustel on suur mõju, näiteks meditsiinis ja transpordisüsteemides. Tavaliselt on need mudelid tõenäosuslikud, andes lisaks ennustusele ka selle tõenäosuse hinnangu. Mudeli ennustatud tõenäosust võib tõlgendada ka kui mudeli enesekindlust ennustuse õigsuse suhtes. Siiski ei pruugi mudeli enesekindlus alati vastata tegelikkusele. Sellisel juhul ei ole mudel hästi kalibreeritud ja selle enesekindluse hinnangut ei saa täielikult usaldada. Mitteusaldusväärsed hinnangud võivad kaasa tuua vale otsuse. Seetõttu on oluline hinnata mudelite kalibreeritust. Väitekiri koosneb kolmest omavahel seotud uurimusest, mis keskenduvad mudelite enesekindluse hinnangute kalibreerimisega seotud ülesannetele ja probleemidele. Esimeses uurimuses töötati välja uus kalibreerimismeetod, Dirichlet’ kalibreerimine, mis on mõeldud mitmeklassiliste mudelite jaoks, ja pakuti välja uudne regulariseerimismeetod ODIR, mis aitab vähendada ülesobitamist ka suure klassiarvuga klassifitseerijate kalibreerimisel. Teises uurimuses käsitleti kalibreerituse hindamist ja pakuti välja uus vaatenurk, testandmetele sobitamise (fit-on-test) lähenemine. See toob esile probleeme kalibreerimisvea hindamisel ja näitab, et kalibreerimisvea hindamine hõlmab paratamatult ka sobitamist. Lisaks töötati välja uus kalibreerimisvea hindamismeetod, mis on ECE meetodi edasiarendus. Kolmandas uurimuses esitati raamistik, mis hõlmab erinevaid määramatuse hinnanguid ümbritsevate objektide tuvastamiseks, eesmärgiga parandada isejuhtivate süsteemide ohutust ja usaldusväärsust. Kokkuvõttes aitavad need uurimused paremini kalibreerida mudelite enesekindluse hinnanguid, paremini hinnata mudelite kalibreeritust ja esitada erinevaid määramatusi ühtses raamistikus.
Machine learning models are widely applied to detection and prediction tasks, for example, object detection and trajectory prediction in autonomous vehicles. Furthermore, they are increasingly utilised in decision-making contexts, including high-impact domains such as medicine and transportation systems. These models are typically probabilistic, providing not only predictions but also estimates of their associated probabilities. These probabilities can be interpreted as the model’s confidence in its predictions. However, this confidence does not always correspond to reality. In such cases, the model is poorly calibrated, and its confidence estimates cannot be fully trusted. Unreliable estimates may lead to incorrect decisions. Therefore, it is important to assess the calibration of such models. This dissertation consists of three interconnected studies that address key challenges in calibrating model confidence estimates. In the first study, a new calibration method, Dirichlet calibration, is developed for multiclass models, along with a novel regularisation method, ODIR, which reduces overfitting when calibrating classifiers with a large number of classes. The second study focuses on calibration evaluation and introduces a new perspective: the fit-on-test view. This perspective highlights challenges in estimating calibration error and demonstrates that evaluating calibration error inherently involves fitting. In addition, a new method is developed for estimating calibration error that extends the estimated calibration error (ECE). The third study presents a framework that integrates multiple types of uncertainty estimates to detect surrounding objects, thereby improving the safety and reliability of autonomous systems. In conclusion, this dissertation introduces new methods for calibrating model confidence estimates, improves calibration evaluation, and proposes a unified framework for representing different types of uncertainty.

Kirjeldus

Doktoritöö elektrooniline versioon ei sisalda publikatsioone

Märksõnad

doktoritööd

Viide