Deep learning architectures for autonomous perception: from sensor auto-calibration to efficient multi-object tracking

Laen...
Pisipilt

Kuupäev

Autorid

Ajakirja pealkiri

Ajakirja ISSN

Köite pealkiri

Kirjastaja

Tartu Ülikooli Kirjastus

Abstrakt

Isejuhtivad autod ja autonoomsed robotid tuginevad ümbritseva maailma mõistmisel ja ohutul töötamisel keerukatele tajusüsteemidele. Tajusüsteemide täpseks tööks on vaja mitmesuguseid andureid ja nende kombinatsioone, näiteks terava pildiga harilikke kaameraid ja lidarit ruumilise sügavuse mõõtmiseks. Selliste süsteemide rajamisega kaasneb kaks mahukat päriselulist probleemi, mis on ka selle doktoritöö teemaks. • „Silmade“ joondamine: sensorid nõuavad täpseks tööks täiuslikku joondamist, mis on käsitsi tehes aeglane ja töömahukas ettevõtmine. • Liikuvate objektide jälgimine: ainult nägemisest ei piisa, auto peab suutma erinevaid liikluses osalejaid, näiteks jalakäijaid ja teisi sõidukeid, korraga jälgida. Seda ülesannet tuntakse mitme objekti jälgimisena (ingl multi-object tracking, MOT). Selleks mõeldud levinumad masinõppemeetodid on aga sageli kohmakad, nõuavad tohutut arvutusmahtu ning võivad siiski väiksemad ja osaliselt varjatud objektid märkamata jätta. See doktoritöö lahendab need probleemid targemate ja tõhusamate masinõppemudelite abil. • Automaatne kalibreerimine: töö esimeses osas tutvustatakse masinõppemudelit NetCalib, mis on autole omamoodi silmaarsti eest. See õpib samm-sammult kaamerapilti ja lidarit iseseisvalt joondama, vajamata selleks inimese sekkumist ja spetsiifilisi füüsilisi sihtmärke. • Täiustatud detailifookus: töö käigus täiustati olemasolevat transformeripõhist MOT-mudelit, parandamaks detailidele keskendumise võimet. See parandas väiksemakasvuliste või kaugemal asuvate jalakäijate tuvastamist ja muutis auto ohutumaks. • Roheline ja tõhus AI: doktoritöö raames muudeti MOT-mudeli arhitektuuri ning loodi kompaktne ja ülitõhus MOTT. Uus mudel töötab ligi kaks korda kiiremini ja vajab vähem arvutusmahtu ning samal ajal säilitab eelmiste mudelite täpsuse. Kokkuvõttes muudeti isejuhtiva auto digitaalne aju kiiremaks ja energiasäästlikumaks, valmistades auto paremini ette päris maailma tänavatel liiklemiseks.
Self-driving cars and autonomous robots rely on complex perception systems to understand the world around them and operate safely. To do this effectively, they use a combination of different sensors, like standard cameras for rich visual details and LiDAR for precise 3D depth. However, building these systems presents two major real-world problems that this dissertation addresses: Aligning the "Eyes": First, the different sensors must be perfectly aligned with each other, which is traditionally a slow, manual, and labor-intensive process. Tracking Moving Objects: Second, once the car can see, it has to track multiple moving objects – a task known as Multi-Object Tracking (MOT), like pedestrians and other vehicles. The current Machine Learning (ML) models used for this are often too bulky, demanding massive amounts of computer power, and they can easily miss smaller, occluded objects. This dissertation solves these challenges by creating smarter, more efficient ML models: Automatic Calibration: The first part of the thesis introduces "NetCalib," an ML model that acts like an automatic eye-doctor for the vehicle. It learns to iteratively align the camera and LiDAR on its own, completely removing the need for human intervention or specialized physical targets. Enhanced Detail Focus: To improve tracking, a Transformer MOT model was upgraded to better focus on small, local details, making it much safer and more accurate at detecting smaller or distant pedestrians. "Green" and Efficient AI: Finally, the research slims down the MOT model into a "green," highly efficient architecture called MOTT. By removing unnecessary components, this new model runs almost twice as fast and uses significantly less computer power, all while maintaining top-tier accuracy. Ultimately, this work makes the digital brains of autonomous vehicles faster, significantly more energy-efficient, and better prepared for real-world roads.  

Kirjeldus

Doktoritöö elektrooniline versioon ei sisalda publikatsioone

Märksõnad

doktoritööd

Viide