Почему победитель офлайн-теста проигрывает в A/B-тесте
Популярные фильмы преобладают не только в обучении, но и в тесте. Угадывая их, модель может получить высокую оценку без хорошей персонализации. Дарья Тихонович предлагает уменьшать доминирование популярных объектов в тестовых взаимодействиях и проверяет связь с прошлыми A/B-результатами.
Видео · на русском
Валидация в RecSys для корреляции с А/В: что работает в контентных рекомендациях / Дарья ТихоновичДарья Тихонович · Опубликовано: 12 марта 2026 г.
Исходный доклад · Открыть оригинал
Проблема находится и в тестовой выборке
Обычная метрика награждает модель за угаданные действия. Если большая часть тестовых взаимодействий относится к нескольким хитам, рекомендация популярных объектов получает преимущество. Обратная крайность — оптимизировать только новизну и поднять странный редкий контент.
Доклад относится к контентным сервисам МТС: кино, книгам и мероприятиям. Это важно для интерпретации компромисса между популярностью и персонализацией.

Смещение в сторону популярных объектов.
Источник: Кадр из докладаЧто меняют при оценке
По частоте взаимодействий определяют чрезмерно популярные объекты. Границу задают через квартиль и межквартильный размах. Лишние тестовые пары «пользователь–объект» случайно сокращают до выбранного уровня. После этого считают привычные метрики.
Меняется именно оценочная выборка. Это не инструкция удалить популярные фильмы из продукта и не обещание автоматически исправить смещения обучения.

Поиск выбросов в распределении популярности.
Источник: Кадр из докладаПараметр выбирают по связи с продуктом
Степень уменьшения популярных взаимодействий регулирует компромисс. Авторы пересчитывают offline-оценки моделей из прежних A/B-тестов и сопоставляют их с продуктовыми результатами. В RecTools доступны соответствующие расчёты и инструменты анализа.
Так получают более информативный ориентир для следующих экспериментов. Сохраняются временное разделение данных, сравнение моделей и наблюдение за несколькими свойствами рекомендаций.

Сравнение PartialAUC и MAP.
Источник: Кадр из докладаЧего ретроспектива не доказывает
В вопросах из зала Тихонович уточняет: анализ завершён недавно, статистики роста числа успешных A/B-тестов ещё нет. Улучшение корреляции на старых экспериментах нельзя пересказать как доказанную будущую экономию экспериментов.
Случайное сокращение также может убрать из теста пользователей с единственным популярным объектом. Взвешивание вместо удаления обсуждается как дальнейшая идея. Запись опубликована в 2026 году, но само выступление относится к AiConf 2024.

Корреляция офлайн-метрик с конверсией в покупку.
Источник: Кадр из доклада