В 2026 году исследователи провели сравнение методов классификации текста, чтобы определить, насколько традиционные подходы, такие как TF-IDF, по-прежнему эффективны в условиях современных технологий. Для этого была выбрана одна задача, один корпус данных и одна метрика, на основе которых были протестированы три подхода: счетный бейзлайн на TF-IDF, сверточная сеть TextCNN и дообученный русский энкодер.
Результаты эксперимента показали, что предобученные трансформеры значительно превосходят традиционные методы по качеству классификации. TF-IDF, который когда-то был стандартом в обработке текста, теперь воспринимается как устаревший метод, не способный справиться с современными задачами обработки естественного языка. Сравнение также включало анализ времени обработки и сложности моделей.
Это исследование подчеркивает важность использования современных подходов в области обработки естественного языка, особенно в условиях быстрого развития технологий. Результаты могут служить основой для дальнейших исследований и разработок в этой области, а также для практического применения в различных задачах классификации текста.