ЯндексRAG3 мин

Как определить, что поисковый запрос связан со свежей новостью

Запрос «Дюна» после выхода фильма означает другое, чем раньше. Для обучения поиска картинок нужно быстро размечать такие изменения, а ручная проверка новостей дорого обходится. Поиск с Алисой собирает актуальный контекст, а отдельная LLM проверяет значимость события и связь с запросом.

Видео · на русском

Как автоматизировать разметку новостных запросов с RAG / Арсений Михайлов

Арсений Михайлов · Опубликовано: 1 ноября 2025 г.

Исходный доклад · Открыть оригинал

Свежесть — свойство запроса в конкретный момент

В поиске картинок отдельно отбирают свежие и старые документы, затем объединяют их. Для итогового ранжирования нужно знать, когда пользователь ожидает именно новости. Таких запросов мало, намерение меняется со временем, а запоздалая разметка уже не отражает прежнюю выдачу. Поэтому кандидатов в новостные запросы собирают и фиксируют сразу.

Две ветви первичного ранжирования.

Две ветви первичного ранжирования.

Источник: Кадр из доклада
03:00 — фрагмент доклада

Почему не хватило одной LLM

Модель без поиска не знает о только что случившемся событии. Но и поисковому ассистенту трудно одновременно найти новости, проверить даты, оценить их важность и принять окончательное решение. Незначительные местные сообщения создавали особенно много ложных срабатываний.

Задачу разделили: первый этап ищет и кратко описывает новости, второй оценивает их по критериям. На втором этапе уже можно использовать модель со статическими знаниями, потому что свежий контекст передан во входе.

06:00 — фрагмент доклада

Ошибки исправляли на стыке этапов

Даты стали перечислять явно: формулировка «последние пять дней» могла привести к новости за прошлый год с подходящими числом и месяцем. Модели разрешили честно сообщать об отсутствии новости или уверенности.

Финальный классификатор подготовили к пустому результату поиска и показали ему примеры реальных ответов предыдущего этапа. Для отдельных типов запросов добавили явные правила. Это уменьшало ошибки всей цепочки, а не только улучшало один промпт.

Ошибки классификации, найденные командой.

Ошибки классификации, найденные командой.

Источник: Кадр из доклада
11:00 — фрагмент доклада

Проверяли не только точность разметки

Сначала сравнили precision и recall с краудом на экспертном наборе, затем вручную сопоставили запросы, отобранные старым и новым процессами. После этого обучили целевой ранжировщик: он должен был сохранить качество относительно обучения на прежней разметке.

Часть ручной разметки оставили для ежедневного контроля и оповещений. Внешние по отношению к проекту модели и поиск могут обновляться, поэтому успешный запуск не отменяет наблюдения.

Практические рекомендации автора.

Практические рекомендации автора.

Источник: Кадр из доклада
13:20 — фрагмент доклада

К какому бюджету относится экономия

В итогах названы примерно 95% экономии расходов на ручную разметку внутри этой задачи и 25% бюджета крауда всего сервиса. Это разные знаменатели. Около 5% прежней разметки задачи сохранили для контроля. К моменту выступления процесс работал полгода. Числа относятся к рассказанному внедрению, а не к универсальной стоимости RAG.

15:30 — фрагмент доклада