Affiliation:
1. Хакасский государственный университет им. Н.Ф. Катанова
2. Katanov State University of Khakasia
Abstract
Представлен обзор основных проблем и методов автоматической классификации текстов. Рассматриваются такие темы, как: выбор исходного лингвистического материала; нейтрализация разницы в размерах текстов; применение дистантного и словарного подходов к классификации; уменьшение размерности текстов; создание словарей; адекватное взвешивание терминов; обучение и функционирование программы-классификатора. В доступной форме описываются процедуры выравнивания текстов по нижнему пределу и логарифмического выравнивания, алгоритмы вычисления косинусной меры близости, Z-коэффициента. Показаны особенности применения теоремы Байеса с целью частеречной классификации и фильтрации спама.
Publisher
Russian Institute for Scientific and Technical Information - VINITI RAS