RAG в Алисе, поддержке и юридическом помощнике
Добавление поиска может улучшить актуальность ответа, но увеличить задержку и даже ухудшить качество. Большое окно модели не устраняет эти проблемы. Андрей Соколов показывает разные способы оценки и обучения для открытого поиска, закрытой базы знаний и агентного сценария.
Исходный доклад · Открыть оригинал
Один изменённый компонент влияет на остальные
Разбиение документов, переформулирование вопроса, поиск, пересортировка и генерация образуют связанную систему. Улучшение одного элемента может изменить вход следующего и неожиданно ухудшить ответ.
Большое контекстное окно не гарантирует устойчивости к шумным или похожим документам. Поэтому задача отбора остаётся даже у моделей, технически принимающих очень длинный текст.
77:03 — фрагмент докладаВ Алисе сочетают три уровня оценки
Проверяют специальные тесты работы с источниками, экспертные оценки ответа и итоговые продуктовые эксперименты. Отдельно наблюдают, подтверждён ли ответ контекстом: красивый ответ может игнорировать найденные документы, а буквальное копирование — быть бесполезным.
Также исследуют чувствительность к числу и порядку фрагментов. Само добавление контекста не должно систематически вредить. Для открытого веб-поиска важно, что содержание источников постоянно меняется.

Проверки устойчивости RAG-системы.
Источник: Кадр из докладаПоиск нужен не каждому запросу одинаково
Дополнительный контекст увеличивает время до первого токена. Если модель уже знает ответ на устойчивый вопрос, обращение к поиску может оказаться лишним. Но для актуальной информации оно необходимо.
Решение принимают по совокупности качества, подтверждённости и задержки. Изменение базовой модели может изменить этот баланс, поэтому однажды выбранное правило нельзя считать вечным.
89:00 — фрагмент докладаЗакрытая поддержка и агент требуют других проверок
В поддержке важны корректный отказ при недостатке знаний и защита закрытой информации. Для обучения используют примеры разного качества контекста и проверяют требуемое поведение.
В юридическом помощнике оценивают уже ход работы: какие инструменты вызваны, нужен ли повторный поиск, корректен ли итог. Сохранённая последовательность действий позволяет обучать и проверять не только последнюю фразу. Это третий доклад трансляции; перерыв после него в главу не включён.
94:00 — фрагмент доклада