Talunimede tuvastamise automatiseerimine Eesti põhikaartide näitel

Laen...
Pisipilt

Kuupäev

Ajakirja pealkiri

Ajakirja ISSN

Köite pealkiri

Kirjastaja

Tartu Ülikool

Abstrakt

Kohanimesid on traditsiooniliselt kogutud uurijate ja huviliste tarbeks kaartidelt käsitsi, kuid arvutitehnika arenedes on võimalik nimekorjet automatiseerida ja seega protsessi kiirendada. Keskseks automatiseeritud lahenduseks on masinõppele toetuv tekstituvastus (OCR – Optical Character Recognition). Kui nimi on olemas kohanimede loendis, saab tuvastustulemuse ühendada selle alusel. Eesti talunimede loendit aga olemas pole, kuigi praegused talunimed, mis on hajaasustusaladel katastriüksuste lähiaadressid, on võimalik ruumipäringuga kätte saada. Käesolevas töös katsetatakse tekstituvastuse mudelite sobivust eestikeelse kaardiandmestiku talunimede tuvastamisele kolme erineva aja Eesti põhikaartide näitel viiel testalal. Taolise andmestiku väljakutsed on nii keel, mis pole OCR-lahenduste peavool, kui ka kaartide müra. Tuvastuseks valiti viis vabavaralist ja kolm mitmemodaalset mudelit ning lisaks loodi vabavaralisele EasyOCR-ile ja Gemini 3-ele põhinev kombineeritud meetod. Adekvaatseid tulemusi saavutati EasyOCR-i ja kõikide mitmemodaalsete mudelite ning kombineeritud meetodiga, mis ühendab kahe mudeli tugevused. Sobivuse mõõdikuks on F1-skoor, mis on tuvastuse saagise ja täpsuse harmooniline keskmine. Lisaks uuriti võimalusi ühendada erinevate aegade nimekihte teisenduskauguse abil, kuid see nõuaks lisaks teist keeletehnoloogilist lahendust tulenevalt nimemuutuste mitmekesisusest. Töö praktiliseks väljundiks on tervet tuvastusprotsessi hõlmav Python-skript.

Kirjeldus

Märksõnad

toponüümika, talunimed

Viide