СберАгенты3 мин

Как Сбер оценивает качество множества банковских агентов

Эксперт не может вручную проверить миллион диалогов в сутки, а общая LLM-оценка плохо разбирается в сложных финансовых запросах. Запросы, ответы и диалоги группируют; эксперты оценивают повторяющиеся группы и отдельно проверяют фактические данные.

Видео · на русском

Saturday ML Party 21.03.2026

Артём Хусаенов · Опубликовано: 22 марта 2026 г.

Исходный доклад · Открыть оригинал

Сначала выбрать правильный навык

Платформа соединяет продуктовых агентов и поверхности: банковское приложение, инвестиционный сервис и другие каналы. Отдельно оценивают маршрутизацию и весь диалог.

Вопрос о возможности войти в ипотечную сделку может требовать анализа накоплений и будущих платежей, а не просто справки об ипотеке. Поиск ключевого слова и поверхностная разметка дают неправильного исполнителя.

45:24 — фрагмент доклада

Повторяющиеся запросы сокращают объём экспертной работы

Команда обнаружила, что значительную часть потока можно группировать. Вместо разметки каждого запроса эксперт работает с кластерами похожих намерений. Когда состав групп стабилен, ранее накопленные оценки переиспользуются.

Способ группировки зависит от канала: разговорные и сложные финансовые запросы требуют разной обработки. Качество кластеров проверяют, ошибки возвращаются команде. Сам факт образования группы ещё не доказывает её однородность.

Ограничения сплошной ручной разметки.

Ограничения сплошной ручной разметки.

Источник: Кадр из доклада
51:00 — фрагмент доклада

От запросов перешли к ответам и диалогам

Внутренний интерфейс показывает примеры, краткое описание группы, долю трафика и поведение участников разговора. Так можно искать незакрытые потребности и оценивать завершение задачи, стиль общения и другие свойства.

Приоритет новых навыков начинают выбирать по реальным группам запросов. Разные метрики остаются разными: хороший тон не означает правильный выбор инструмента или завершённую задачу.

Оценка кластеров ответов и диалогов.

Оценка кластеров ответов и диалогов.

Источник: Кадр из доклада
57:00 — фрагмент доклада

Персональные цифры нельзя проверить через кластер

Одинаково сформулированные ответы могут содержать разные остатки, доходы или параметры кредита. Поэтому кластерная оценка не подтверждает их фактическую правильность.

Для расчётов используют детерминированные функции и проверяют две границы: корректен ли вызов с параметрами и верно ли его результат перенесён в ответ. По докладу мониторинг охватывает около 80% трафика; оставшееся покрытие и фактология требуют отдельных решений.

59:00 — фрагмент доклада