Published October 26, 2025 | Version v1

SmartUzText: Гибридный подход к автоматической классификации узбекоязычных текстов на основе морфологического анализа и машинного обучения

  • 1. Авторы: Ассистент кафедры «Автоматизация и программная инженерия»:
  • 2. Студент кафедры «Автоматизация и программная инженерия»:

Description

Настоящее исследование посвящено разработке инновационного программного инструментария для автоматической классификации текстов на узбекском языке, являющемся типичным представителем агглютинативных языков с ограниченными ресурсами. В работе представлен гибридный подход, интегрирующий методы морфологического анализа с современными алгоритмами машинного обучения (Naive Bayes, Support Vector Machines, Conditional Random Fields). Был сформирован специализированный корпус узбекоязычных текстов объемом 746,738 токенов, структурированный по тематическим категориям (новости, спорт, культура, экономика, образование). Экспериментальная валидация продемонстрировала высокую эффективность предложенного подхода: точность классификации достигла 92.75% (F1-мера), что существенно превосходит базовые методы. Разработанный инструмент может быть адаптирован для других тюркских языков с низкой ресурсообеспеченностью.

Files

375-383.pdf

Files (332.7 kB)

Name Size Download all
md5:57221722186d74a4e7fae602e0a4a866
332.7 kB Preview Download

Additional details

References

  • [1] Hirschberg, J., & Manning, C. D. (2015). Advances in natural language processing. Science, 349(6245), 261-266.