Published October 4, 2026 | Version v1

ЛИНГВИСТИЧЕСКИЕ ИНДИКАТОРЫ ДЛЯ АВТОМАТИЧЕСКОГО ОБНАРУЖЕНИЯ И ПОИСКА АФОРИЗМОВ

Description

В статье рассматривается проблема автоматического обнаружения, классификации и индексирования афоризмов в текстовых корпусах. Задача анализируется на основе моделей обнаружения фрагментов текста, классификации предложений и ранжирования в рамках НЛП и интерпретируется как сложная задача типа «needle-in-the-haystack». Она основана на том, что для обнаружения афоризмов следует использовать комбинацию графико-пунктуационных, количественных, лексико-морфологических, синтаксических, семантических, прагматических и стилистических индикаторов; процесс представлен в виде четырехэтапного конвейера, состоящего из поиска кандидатов, оценки, разметки и ранжирования. Также рассматривается необходимая для узбекского языка инфраструктура предварительной обработки (нормализация, токенизация, лемматизация, POS-тегирование, синтаксический анализ зависимостей) на основе существующих лингвистических ресурсов (BBPOS, узбекский UD-корпус).

Files

1 (12).pdf

Files (322.2 kB)

Name Size Download all
md5:35d4379431c5b63d5a93dc2b5ae87209
322.2 kB Preview Download