Открыть сервисСервис

Релевантность в информационном поиске

Релевантность — это мера соответствия полученного результата (документа, ответа, товара, рекламного объявления) запросу или информационной потребности пользователя. Понятие возникло в теории информационного поиска и библиотечном деле, а позднее распространилось на поисковые системы, рекомендательные алгоритмы, интернет-рекламу и обработку естественного языка. Релевантным считается результат, который не просто содержит искомые слова, а отвечает на фактическую потребность человека, обратившегося с запросом.

Общее понятие

В основе понятия лежит различие между формальным совпадением и смысловым соответствием. Запрос «температура кипения воды» может встретиться в тексте, где это словосочетание лишь упомянуто вскользь, и в статье, где приведено точное значение. Оба документа формально содержат нужные слова, но релевантен из них только второй. Поэтому в теории поиска различают:

  • формальную релевантностьсовпадение терминов запроса и документа по правилам, заданным алгоритмом;
  • смысловую (семантическую) релевантность — соответствие фактическому смыслу запроса;
  • пертинентность — субъективное соответствие результата реальной потребности конкретного пользователя.

Последнее понятие ввёл в 1970-х годах американский исследователь Т. Сарачевич, разделивший объективное соответствие запросу и субъективную удовлетворённость человека.

История

Проблема соответствия запроса и документа возникла вместе с научными библиотеками. В середине XX века, с появлением механизированных и электронных поисковых систем, она стала технической задачей. В 1950–1960-х годах работы К. Муэрса и Г. Сэлтона заложили основы автоматической обработки текстов и оценки поисковых систем. Критерии точности и полноты выдачи, разработанные в тот период, применяются до сих пор.

С развитием интернета и массовых поисковых систем (в России заметную роль играли «Рамблер», «Яндекс», позднее — Google) релевантность превратилась в ключевой параметр ранжирования. Алгоритмы стали учитывать не только слова, но и ссылочный авторитет страниц, поведение пользователей, регион и язык запроса.

Виды и уровни

В поисковых системах выделяют несколько уровней оценки:

УровеньЧто оцениваетсяПример фактора
Текстовое соответствиеСовпадение слов и словоформВхождение ключевых слов
Семантическое соответствиеСмысл запроса и документаСинонимы, тематическая близость
ПоведенческийРеакция пользователейКлики, время на странице, отказы
ПерсональныйИнтересы конкретного человекаИстория поиска, регион

Отдельно рассматривают релевантность в контекстной рекламе: объявление считается релевантным, если оно соответствует не только ключевой фразе, но и содержанию страницы, на которой показывается.

Метрики оценки

Качество выдачи измеряют количественно. Основные метрики:

  • Точность (precision) — доля релевантных документов среди выданных.
  • Полнота (recall) — доля найденных релевантных документов от всех существующих.
  • F-мера — гармоническое среднее точности и полноты.
  • DCG и NDCG — метрики, учитывающие позицию документа в списке: чем выше релевантный результат, тем больше вклад.
  • MAP — средняя точность по нескольким запросам.

Эти показатели применяются при тестировании поисковых алгоритмов и в задачах машинного обучения.

Технологии

Современные системы определяют релевантность с помощью статистических и нейронных методов. Классическая модель TF-IDF оценивает важность слова для документа в коллекции, а векторные модели (например, BM25) учитывают частоту терминов и длину текста. С 2010-х годов широко применяются нейросетевые языковые модели, строящие векторные представления (эмбеддинги) запросов и документов: близость векторов отражает смысловое сходство. Такие подходы лежат в основе семантического поиска и систем вопросов-ответов.

Применение

Понятие релевантности используется в нескольких областях:

Значение и ограничения

Релевантность — центральный критерий качества любой информационно-поисковой системы. Вместе с тем её нельзя измерить абсолютно объективно: разные пользователи при одном запросе ожидают разного, а оценка смысла текста алгоритмом всегда приблизительна. Существуют и намеренные искажения — поисковая оптимизация, при которой страницы подстраиваются под алгоритм в ущерб содержанию. Это заставляет разработчиков постоянно совершенствовать методы оценки, сочетая автоматические метрики с ручной проверкой асессорами.

В российском законодательстве и практике отдельно регулируется выдача информации: операторы поисковых систем обязаны исключать из выдачи ссылки на ресурсы, распространение которых запрещено, что также влияет на формирование итоговой выдачи.

Источники: Сэлтон Г. «Автоматическая обработка, хранение и поиск информации»; Сарачевич Т. «Introduction to Information Science»; Маннинг К., Рагхаван П., Шютце Х. «Введение в информационный поиск»; документация поисковых систем «Яндекс» и Google по ранжированию; материалы по метрикам информационного поиска (TREC).