Result Details

Nalezení slovních kořenů v češtině

CHMELAŘ, P.; HELLEBRAND, D.; HRUŠECKÝ, M.; BARTÍK, V. Nalezení slovních kořenů v češtině. CEUR Workshop Proceedings, 2011, roč. 2011, č. 802, s. 1-12. ISSN: 1613-0073.

English title

Czech Stemming Algorithm

Type

journal article

Language

Czech

Authors

Chmelař Petr, Ing., DIFS (FIT)
Hellebrand David, Ing.
Hrušecký Michal
Bartík Vladimír, Ing., Ph.D., DIFS (FIT)

Abstract

Cílem bylo vytvořit stematizační algoritmus pro český jazyk
založený na gramatických pravidlech jako doplněk k metodám používa-
jícím slovník pro vyhledávání a dolování českého textu. Článek obsahuje
základy slovotvorby českého jazyka pro různé slovní druhy, popis problematiky stematizace a několika stematizačních a lematizačních algoritmů.
Hlavním přínosem této práce je Snowball implementace stematizačního
algoritmu českého jazyka na základě kompletní sady všech předpon a
přípon, které se mohou v českém jazyce vyskytovat.

English abstract

The goal was to create an algorithm for stemming Czech language based on
grammatical rules, in addition to methods using vocabulary for retrieval and
mining of Czech texts. The article includes the basics of Czech word formation
for different word classes, description of problems and several stemming and lemmatization algorithms. The main contribution of this work is the implementation
of the Snowball stemming algorithm for the Czech language based on complete
sets of all prefixes and suffixes, which may occur in Czech words.

English keywords

Lemmatization, stemmization, Snowball, Czech, grammar.

URL

http://www.ceur-ws.org/Vol-802

Published

2011

Pages

1–12

Journal

CEUR Workshop Proceedings, vol. 2011, no. 802, ISSN 1613-0073

Book

Selected papers from the 10th annual Czech and Slovak knowledge technology conference (Znalosti 2011)

Publisher

Aachen University of Technology

Place

Aachen

BibTeX

@article{BUT91156,
  author="Petr {Chmelař} and David {Hellebrand} and Michal {Hrušecký} and Vladimír {Bartík}",
  title="Nalezení slovních kořenů v češtině",
  journal="CEUR Workshop Proceedings",
  year="2011",
  volume="2011",
  number="802",
  pages="1--12",
  issn="1613-0073",
  url="http://www.ceur-ws.org/Vol-802"
}

Projects

Security-Oriented Research in Information Technology, MŠMT, Institucionální prostředky SR ČR (např. VZ, VC), MSM0021630528, start: 2007-01-01, end: 2013-12-31, running

Research groups

Information and Database Systems Research Group (RG IS)

Departments

Department of Information Systems (DIFS)