Talunimede tuvastamise automatiseerimine Eesti põhikaartide näitel

dc.contributor.advisorAunap, Raivo, juhendaja
dc.contributor.advisorOrasmaa, Siim, juhendaja
dc.contributor.advisorTampuu, Ardi, juhendaja
dc.contributor.authorAnttila, Maria
dc.contributor.otherTartu Ülikool. Geograafia osakondet
dc.contributor.otherTartu Ülikool. Loodus- ja täppisteaduste valdkondet
dc.date.accessioned2026-07-03T07:40:19Z
dc.date.available2026-07-03T07:40:19Z
dc.date.issued2026
dc.description.abstractKohanimesid on traditsiooniliselt kogutud uurijate ja huviliste tarbeks kaartidelt käsitsi, kuid arvutitehnika arenedes on võimalik nimekorjet automatiseerida ja seega protsessi kiirendada. Keskseks automatiseeritud lahenduseks on masinõppele toetuv tekstituvastus (OCR – Optical Character Recognition). Kui nimi on olemas kohanimede loendis, saab tuvastustulemuse ühendada selle alusel. Eesti talunimede loendit aga olemas pole, kuigi praegused talunimed, mis on hajaasustusaladel katastriüksuste lähiaadressid, on võimalik ruumipäringuga kätte saada. Käesolevas töös katsetatakse tekstituvastuse mudelite sobivust eestikeelse kaardiandmestiku talunimede tuvastamisele kolme erineva aja Eesti põhikaartide näitel viiel testalal. Taolise andmestiku väljakutsed on nii keel, mis pole OCR-lahenduste peavool, kui ka kaartide müra. Tuvastuseks valiti viis vabavaralist ja kolm mitmemodaalset mudelit ning lisaks loodi vabavaralisele EasyOCR-ile ja Gemini 3-ele põhinev kombineeritud meetod. Adekvaatseid tulemusi saavutati EasyOCR-i ja kõikide mitmemodaalsete mudelite ning kombineeritud meetodiga, mis ühendab kahe mudeli tugevused. Sobivuse mõõdikuks on F1-skoor, mis on tuvastuse saagise ja täpsuse harmooniline keskmine. Lisaks uuriti võimalusi ühendada erinevate aegade nimekihte teisenduskauguse abil, kuid see nõuaks lisaks teist keeletehnoloogilist lahendust tulenevalt nimemuutuste mitmekesisusest. Töö praktiliseks väljundiks on tervet tuvastusprotsessi hõlmav Python-skript.
dc.identifier.urihttps://hdl.handle.net/10062/123022
dc.language.isoet
dc.publisherTartu Ülikool
dc.rightsAttribution-NonCommercial-NoDerivs 3.0 Estoniaen
dc.rights.urihttp://creativecommons.org/licenses/by-nc-nd/3.0/ee/
dc.subjecttoponüümika
dc.subjecttalunimed
dc.subject.othermagistritöödet
dc.titleTalunimede tuvastamise automatiseerimine Eesti põhikaartide näitel
dc.typeThesis

Failid

Originaal pakett

Nüüd näidatakse 1 - 1 1
Laen...
Pisipilt
Nimi:
Anttila_Maria.pdf
Suurus:
7.91 MB
Formaat:
Adobe Portable Document Format