16+
DOI: 10.18413/2518-1092-2026-11-3-0-4

ОПТИМИЗАЦИЯ ГИБРИДНОГО АЛГОРИТМА ПОИСКА В ТЕКСТОВЫХ КОРПУСАХ НА ОСНОВЕ МНОГОУРОВНЕВЫХ МЕТРИК РЕЛЕВАНТНОСТИ

Актуальность исследования обусловлена экспоненциальным ростом объемов неструктурированных текстовых данных и возрастающими требованиями к скорости и релевантности их обработки в таких прикладных областях, как анализ новостных потоков, интеллектуальный поиск и обработка естественного языка (NLP). Существующие алгоритмы поиска часто сталкиваются с проблемами низкой точности из-за морфологической сложности языков (например, русского), наличия большого количества шумовых слов и необходимости учета семантической близости. Цель работы – разработка и исследование гибридного алгоритма поиска, сочетающего метрики лексического соответствия, морфологического анализа (стемминг) и взвешенного ранжирования для повышения полноты и точности поиска в текстовых корпусах. Научная новизза заключается в предложенной многоуровневой метрике релевантности, которая интегрирует подсчет точных совпадений, анализ основ слов с использованием оптимизированного стемминга для русского языка и временные характеристики документов. Методология включает разработку алгоритма, его программную реализацию и сравнительный анализ эффективности на реальном наборе данных, а именно новостей. В ходе эксперимента подтверждено, что гибридный подход позволяет достичь более высокой точности (на 15-20%) по сравнению с базовыми методами, особенно при работе с разносклоняемыми формами слов и составными запросами. Выводы работы указывают на перспективность дальнейшего развития предложенного подхода за счет интеграции семантических векторных моделей и глубокого обучения для учета контекстной близости понятий.

Количество просмотров: 16 (смотреть статистику)
Количество скачиваний: 47
Полный текст (PDF)Скачать XMLК списку статей
  • Комментарии
  • Список литературы

Пока никто не оставил комментариев к этой публикации.
Вы можете быть первым.

Оставить комментарий: