Detail práce

Pokročilé metody strojového učení pro klasifikaci textu

Bakalářská práce Student: Dočekal Martin Akademický rok: 2016/2017 Vedoucí: Smrž Pavel, doc. RNDr., Ph.D.
Název anglicky
Advanced Machine-Learning Methods for Text Classification
Jazyk práce
český
Abstrakt

Tato práce se zabývá pokročilými metodami strojového učení pro klasifikaci textu. Metody jsou nejprve popsány a poté je na základě těchto metod vytvořen systém sloužící pro klasifikaci textových dokumentů. Systém poskytuje také nástroje pro předzpracování dokumentů a hodnocení klasifikátoru. Práce uvádí použití systému na úloze v reálných podmínkách.

Klíčová slova

strojové učení, extrakce příznaků, Bag-of-words, TF-IDF, word2vec, doc2vec, hašování příznaků, k-nejbližších sousedů, Multinomiální naivní Bayes, Support Vector Machine, klasifikace, vyhodnocování klasifikátoru, předzpracování, slučování klasifikačních metod, vyvažovací algoritmy

Ústav
Studijní program
Informační technologie
Soubory
Stav
obhájeno, hodnocení B
Obhajoba
14. června 2017
Oponent
Průběh obhajoby

Student nejprve prezentoval výsledky, kterých dosáhl v rámci své práce. Komise se poté seznámila s hodnocením vedoucího a posudkem oponenta práce. Student následně odpověděl na otázky oponenta a na další otázky přítomných. Komise se na základě posudku oponenta, hodnocení vedoucího, přednesené prezentace a odpovědí studenta na položené otázky rozhodla práci hodnotit stupněm "B".

Otázky u obhajoby
  1. V práci uvádíte, že výstupy z nástroje Doc2Vec byly klasifikovány pomocí k nejbližších sousedů, pro k rovno 3. Můžete komisi zdůvodnit, proč jste vybral zrovna tuto hodnotu? V práci to nikde uvedeno není.
  2. V kapitole 5 uvádíte, že nejhorších výsledků bylo dosaženo za použití nástroje FastText. Máte představu, proč tento nástroj dosahoval tak špatných výsledků v porovnání s dalšími algoritmy?
Komise
Zbořil František V., doc. Ing., CSc. (UITS FIT VUT), předseda
Burget Lukáš, doc. Ing., Ph.D. (UPGM FIT VUT), člen
Hliněná Dana, doc. RNDr., Ph.D. (UMAT FEKT VUT), člen
Matoušek Petr, doc. Ing., Ph.D., M.A. (UIFS FIT VUT), člen
Zachariášová Marcela, Ing., Ph.D. (UPSY FIT VUT), člen
Citace
DOČEKAL, Martin. Pokročilé metody strojového učení pro klasifikaci textu. Brno, 2017. Bakalářská práce. Vysoké učení technické v Brně, Fakulta informačních technologií. 2017-06-14. Vedoucí práce Smrž Pavel. Dostupné z: https://www.fit.vut.cz/study/thesis/19757/
BibTeX
@bachelorsthesis{FITBT19757,
    author = "Martin Do\v{c}ekal",
    type = "Bakal\'{a}\v{r}sk\'{a} pr\'{a}ce",
    title = "Pokro\v{c}il\'{e} metody strojov\'{e}ho u\v{c}en\'{i} pro klasifikaci textu",
    school = "Vysok\'{e} u\v{c}en\'{i} technick\'{e} v Brn\v{e}, Fakulta informa\v{c}n\'{i}ch technologi\'{i}",
    year = 2017,
    location = "Brno, CZ",
    language = "czech",
    url = "https://www.fit.vut.cz/study/thesis/19757/"
}
Nahoru