Näitelausete korpuspõhine automaattuvastus eesti keele õppesõnastikele

dc.contributor.advisorPool, Raili, juhendaja
dc.contributor.advisorKallas, Jelena, juhendaja
dc.contributor.authorKoppel, Kristina
dc.contributor.otherTartu Ülikool. Humanitaarteaduste ja kunstide valdkondet
dc.date.accessioned2020-02-20T13:15:03Z
dc.date.available2020-02-20T13:15:03Z
dc.date.issued2020-02-20
dc.descriptionVäitekirja elektrooniline versioon ei sisalda publikatsiooneet
dc.description.abstractNäitelause täidab sõnastikus kindlat eesmärki, aidates aru saada sõna tähendusest ja illustreerides sõna erinevaid kasutuskontekste. Näitelausete põhiallikas on mahukas tekstikorpus, kust aga käsitsi on näitelauset leida väga keeruline. Elektroonilise leksikograafia arenguga on Eestisse jõudnud mitmed töövahendid, mis aitavad automaatselt tuvastada eri sõnastike jaoks vajalikku infot, sealhulgas näitelauseid. Väitekirjas uuritakse, missugused parameetrid iseloomustavad Eesti Keele Instituudis koostatud sõnastike "Eesti keele sõnaraamat 2019", "Eesti keele põhisõnavara sõnastik 2014", "Eesti keele naabersõnad 2019" näitelauseid ning "Eesti keele A1−C1 õpikute korpuse 2018" lauseid. Uurimuse eesmärk on välja töötada meetod, mis võimaldab neid parameetreid arvestades korpusest automaatselt tuvastada eesti keele õppijatele sobivaid lauseid. Töö keskmes on reeglipõhine lähenemine, mida rakendatakse korpuspäringusüsteemi Sketch Engine integreeritud tööriista GDEX ehk Good Dictionary Examples näitel. Parameetrite häälestamiseks on osaliselt kasutatud ka masinõppe elemente. Sõnastiku näitelausete ja õpikulausete analüüs näitas, et hea eesti keele näitelause peab olema täislause ja vastama muuhulgas järgmistele parameetritele: on 4–20 sõnet pikk; ei sisalda sõnesid, mis on pikemad kui 20 tähemärki; ei alga teatud sõnaliikidega (nt sidesõnaga) ega tagasi viitavate sõnade (nt sellepärast) või sõnapaaridega (nt sellisel puhul); ei sisalda vulgaarseid ja halvustavaid sõnu, madala sagedusega sõnu jmt. Uurimuse tulemusena on loodud "Eesti keele õppekorpus 2018 (etSkELL)", mis sisaldab ainult välja töötatud parameetritele vastavaid lauseid. Õppekorpus on omakorda aluseks eesti keele õppekeskkonnale Sketch Engine for Estonian Language Learning ehk etSkELL ja veebilausetele Eesti Keele Instituudi keeleportaalis Sõnaveeb.et
dc.description.abstractThe function of an example sentence in a dictionary is to help the reader understand the meaning of the headword and illustrate its contexts of use. Nowadays, the main source of example sentences is a large text corpus, where suitable sentences are hard to find. Luckily, e-lexicography has generated automatic tools to help detect various information for dictionaries, including example sentences. The dissertation examines certain parameters of the example sentences presented in the Dictionary of Estonian (2019), Basic Estonian Dictionary (2014), Estonian Collocations Dictionary (2019), and Estonian Coursebook Corpus (2018); all four were compiled at the Institute of the Estonian language. The aim of my study is to elaborate an automatic method using parameters which identify sentences suitable for learners of Estonian. To that end, a rule-based approach was applied to the example of Good Dictionary Examples (GDEX) integrated in the Sketch Engine corpus query tool. Machine learning elements were also adopted to fine-tune the parameters. According to the analysis of the example sentences used in the dictionaries and coursebook sentences, a good Estonian example sentence should be a full sentence meeting, inter alia, the following parameters: length 4–20 tokens; no tokens longer than 20 characters; never begins with certain parts of speech (e.g., conjunction) or an anaphoric word (e.g., sellepärast ‘this is why’) or word pair (e.g., sellisel puhul ‘in such a case’); and vulgar or disparaging words, rare words, etc., are excluded. The study resulted in the compilation of the Estonian Corpus for Learners 2018 (etSkELL), which contains no other sentences but those corresponding to the developed parameters. The corpus, in turn, serves as the basis for the corpus-based web tool Sketch Engine for Estonian Language Learning (etSkELL) and the web sentences in the language portal Sõnaveeb of the Institute of the Estonian Language.en
dc.description.urihttps://www.ester.ee/record=b5302935et
dc.identifier.isbn978-9949-03-300-3
dc.identifier.isbn978-9949-03-301-0 (pdf)
dc.identifier.issn1406-5657
dc.identifier.urihttp://hdl.handle.net/10062/67138
dc.language.isoestet
dc.relation.ispartofseriesDissertationes linguisticae Universitatis Tartuensis;38
dc.rightsopenAccesset
dc.rightsAttribution-NonCommercial-NoDerivatives 4.0 International*
dc.rights.urihttp://creativecommons.org/licenses/by-nc-nd/4.0/*
dc.subjectEstonian languageen
dc.subjectlanguage instructionen
dc.subjectdictionariesen
dc.subjectonline dictionariesen
dc.subjecte-lexicographyen
dc.subjectcorpora (ling.)en
dc.subjectcorpus lexicographyen
dc.subjectautomated lexicographyen
dc.subjectlinguistic examplesen
dc.subject.otherdissertatsioonidet
dc.subject.otherETDet
dc.subject.otherdissertationset
dc.subject.otherväitekirjadet
dc.subject.othereesti keelet
dc.subject.otherkeeleõpetuset
dc.subject.othersõnastikudet
dc.subject.otherveebisõnastikudet
dc.subject.otherkeelenäitedet
dc.subject.otherlausetüübidet
dc.subject.otherkorpused (keelet.)et
dc.subject.otherkorpuslingvistikaet
dc.subject.othere-leksikograafiaet
dc.subject.otherkorpusleksikograafiaet
dc.subject.otherautomaatne leksikograafiaet
dc.titleNäitelausete korpuspõhine automaattuvastus eesti keele õppesõnastikeleet
dc.title.alternativeCorpus-based automatic detection of example sentences for dictionaries for Estonian learnersen
dc.typeThesiset

Files

Original bundle

Now showing 1 - 1 of 1
Loading...
Thumbnail Image
Name:
koppel_kristina.pdf
Size:
6.4 MB
Format:
Adobe Portable Document Format
Description:

License bundle

Now showing 1 - 1 of 1
No Thumbnail Available
Name:
license.txt
Size:
1 B
Format:
Item-specific license agreed upon to submission
Description: