Detail práce

Doplňování interpunkce do automatického přepisu řeči

Bakalářská práce Student: Ščavnický Tomáš Akademický rok: 2016/2017 Vedoucí: Szőke Igor, Ing., Ph.D.
Název anglicky
Automatic Adding of Punctuation into Speech Transcript
Jazyk práce
český
Abstrakt

Táto práca sa zaoberá rekonštrukciou interpunkcie vo výstupoch systémov na automatický prepis reči. Výsledný systém by mal byť schopný rekonštruovať interpunkciu vo všeobecnej zväčša hovorenej angličtine s rozumnou mierou presnosti. Prirodzený ľudský jazyk sa v istých prípadoch sa môže javiť nedeterministický a tvorba reťazcov často podlieha veľkému množstvu gramatických pravidiel. Kvôli tomu boli na predikciu interpunkcie vybrané algoritmy strojového učenia pre ich schopnosť rozoznať komplikované vzory v dátach. Bolo vykonaných niekoľko experimentov s rekurentnými neurónovými sieťami za účelom nájdenia najvhodnejšej architektúry modelu. Výsledné modely vytvorené počas týchto experimentov dosahujú presnosť porovnateľnú ak nie lepšiu než práce, v súčasnosti považované za najlepšie v obore.

Klíčová slova

spracovanie prirodzeného jazyka, rekurentné neurónové siete, strojové učenie

Ústav
Studijní program
Informační technologie
Soubory
Stav
obhájeno, hodnocení B
Obhajoba
16. června 2017
Oponent
Průběh obhajoby

Student nejprve prezentoval výsledky, kterých dosáhl v rámci své práce. Komise se poté seznámila s hodnocením vedoucího a posudkem oponenta práce. Student následně odpověděl na otázky oponenta a na další otázky přítomných. Komise se na základě posudku oponenta, hodnocení vedoucího, přednesené prezentace a odpovědí studenta na položené otázky rozhodla práci hodnotit stupněm B.

Otázky u obhajoby
  1. Bylo by možné použít 'dlouhou pauzu' jako další slovní symbol na vstupu modelu?
  2. Proč byl použit optimalizační algoritumus Adagrad? V čem se liší nebo je výhodnější než standardní metoda Stochastic Gradient Descent?
  3. Byl použit dropout 0.4, to je poměrně vysoká hodnota. Jaké jsou další možnosti regularizace trénování modelu?
  4. Jakým způsobem by bylo možné do jednoho modelu přidat podporu predikce více různých interpunkčních symbolů?
Komise
Smrž Pavel, doc. RNDr., Ph.D. (UPGM FIT VUT), předseda
Bidlo Michal, doc. Ing., Ph.D. (UPSY FIT VUT), člen
Hliněná Dana, doc. RNDr., Ph.D. (UMAT FEKT VUT), člen
Rozman Jaroslav, Ing., Ph.D. (UITS FIT VUT), člen
Ryšavý Ondřej, doc. Ing., Ph.D. (UIFS FIT VUT), člen
Citace
ŠČAVNICKÝ, Tomáš. Doplňování interpunkce do automatického přepisu řeči. Brno, 2017. Bakalářská práce. Vysoké učení technické v Brně, Fakulta informačních technologií. 2017-06-16. Vedoucí práce Szőke Igor. Dostupné z: https://www.fit.vut.cz/study/thesis/19557/
BibTeX
@bachelorsthesis{FITBT19557,
    author = "Tom\'{a}\v{s} \v{S}\v{c}avnick\'{y}",
    type = "Bakal\'{a}\v{r}sk\'{a} pr\'{a}ce",
    title = "Dopl\v{n}ov\'{a}n\'{i} interpunkce do automatick\'{e}ho p\v{r}episu \v{r}e\v{c}i",
    school = "Vysok\'{e} u\v{c}en\'{i} technick\'{e} v Brn\v{e}, Fakulta informa\v{c}n\'{i}ch technologi\'{i}",
    year = 2017,
    location = "Brno, CZ",
    language = "czech",
    url = "https://www.fit.vut.cz/study/thesis/19557/"
}
Nahoru