МТСRecSys3 мин

Почему победитель офлайн-теста проигрывает в A/B-тесте

Популярные фильмы преобладают не только в обучении, но и в тесте. Угадывая их, модель может получить высокую оценку без хорошей персонализации. Дарья Тихонович предлагает уменьшать доминирование популярных объектов в тестовых взаимодействиях и проверяет связь с прошлыми A/B-результатами.

Исходный доклад · Открыть оригинал

Проблема находится и в тестовой выборке

Обычная метрика награждает модель за угаданные действия. Если большая часть тестовых взаимодействий относится к нескольким хитам, рекомендация популярных объектов получает преимущество. Обратная крайность — оптимизировать только новизну и поднять странный редкий контент.

Доклад относится к контентным сервисам МТС: кино, книгам и мероприятиям. Это важно для интерпретации компромисса между популярностью и персонализацией.

Смещение в сторону популярных объектов.

Смещение в сторону популярных объектов.

Источник: Кадр из доклада
04:00 — фрагмент доклада

Что меняют при оценке

По частоте взаимодействий определяют чрезмерно популярные объекты. Границу задают через квартиль и межквартильный размах. Лишние тестовые пары «пользователь–объект» случайно сокращают до выбранного уровня. После этого считают привычные метрики.

Меняется именно оценочная выборка. Это не инструкция удалить популярные фильмы из продукта и не обещание автоматически исправить смещения обучения.

Поиск выбросов в распределении популярности.

Поиск выбросов в распределении популярности.

Источник: Кадр из доклада
08:00 — фрагмент доклада

Параметр выбирают по связи с продуктом

Степень уменьшения популярных взаимодействий регулирует компромисс. Авторы пересчитывают offline-оценки моделей из прежних A/B-тестов и сопоставляют их с продуктовыми результатами. В RecTools доступны соответствующие расчёты и инструменты анализа.

Так получают более информативный ориентир для следующих экспериментов. Сохраняются временное разделение данных, сравнение моделей и наблюдение за несколькими свойствами рекомендаций.

Сравнение PartialAUC и MAP.

Сравнение PartialAUC и MAP.

Источник: Кадр из доклада
26:00 — фрагмент доклада

Чего ретроспектива не доказывает

В вопросах из зала Тихонович уточняет: анализ завершён недавно, статистики роста числа успешных A/B-тестов ещё нет. Улучшение корреляции на старых экспериментах нельзя пересказать как доказанную будущую экономию экспериментов.

Случайное сокращение также может убрать из теста пользователей с единственным популярным объектом. Взвешивание вместо удаления обсуждается как дальнейшая идея. Запись опубликована в 2026 году, но само выступление относится к AiConf 2024.

Корреляция офлайн-метрик с конверсией в покупку.

Корреляция офлайн-метрик с конверсией в покупку.

Источник: Кадр из доклада
33:00 — фрагмент доклада