Google / YouTubeRecSys3 мин

YouTube 2016: отбор кандидатов и ранжирование по времени просмотра

Миллионы видео нельзя оценивать тяжёлой моделью на каждый запрос, а кликабельность не равна полезному просмотру. Две нейросети решают разные задачи: сузить каталог и упорядочить показы для конкретной поверхности.

Публикация · на английском

Deep Neural Networks for YouTube Recommendations

Paul Covington, Jay Adams, Emre Sargin · Опубликовано: 15 сентября 2016 г.

Почему нужны две модели

Первая сеть по истории просмотров, поискам и контексту находит сотни кандидатов. Вторая получает более богатые признаки каждого показа и определяет порядок. В итоговый список могут попадать кандидаты из нескольких источников.

Разделение позволяет тратить больше вычислений на небольшое число объектов. Оно также объясняет, почему хорошая модель отбора не обязана быть хорошим финальным ранжировщиком.

Две стадии рекомендаций YouTube: отбор кандидатов и ранжирование.

Две стадии рекомендаций YouTube: отбор кандидатов и ранжирование.

Источник: Оригинал, страница 2
Этот фрагмент в оригинале

Как обучают поиск среди миллионов классов

Отбор ставят как предсказание следующего просмотренного видео. Векторы предыдущих просмотров и поисковых токенов агрегируют, соединяют с другими признаками и пропускают через сеть. При обучении используют выборку отрицательных классов; при применении ищут ближайшие видео к вектору пользователя.

Возраст обучающего примера помогает учитывать изменение популярности. Это время примера относительно окна обучения, а не просто возраст самого ролика.

Этот фрагмент в оригинале

Нужно осторожно выбирать обучающий сигнал

Авторы используют просмотры из разных источников, чтобы не замыкаться на собственных прежних рекомендациях. Фиксированное число примеров на пользователя уменьшает доминирование самых активных.

Предсказание будущего просмотра оказалось полезнее восстановления случайно скрытого элемента: последнее может подмешивать информацию из будущего. Но даже доступный текущий запрос способен сделать задачу слишком лёгкой — воспроизведение поисковой выдачи не равно хорошей главной странице.

Этот фрагмент в оригинале

Ранжирование оптимизирует ожидаемое время

Ранжировщик обучается на показах, учитывает прежние реакции на видео и близкий контент, а также происхождение кандидата. Только CTR может продвигать кликбейт, поэтому цель связывают с ожидаемым временем просмотра на показ.

В описанном способе положительные примеры взвешиваются временем просмотра. Offline-оценки помогают исследованию, но окончательное решение принимают по живым A/B-тестам: авторы прямо отмечают возможное расхождение.

Этот фрагмент в оригинале