Wildberries: один визуальный энкодер для множества проверок
Отдельный сервис и тяжёлая модель на каждую проверку перестали масштабироваться. Общий энкодер изображения обслуживает небольшие классификаторы.
Слайды · на русском
Как мы автоматизировали модерацию карточек товаров с помощью Computer Vision в WildberriesОткрыть оригинальные слайдыДмитрий Колесников, HighLoad++ 2025 · Опубликовано: 7 ноября 2025 г.
Почему понадобилось объединение
Ежедневная нагрузка: более 12 млн карточек, около 50 млн изображений и 500 тысяч видео. Разрозненные сервисы дублировали обработку; одна модель занимала около 1,75 ГБ видеопамяти.

Слайд 7: объём модерации на момент доклада.
Источник: WildberriesЕдиный вызов ещё не экономит память
Модели привели к TensorRT FP16, предобработку перенесли в Triton через DALI. Ансамбль уменьшил сетевые обращения, но самостоятельные модели продолжали занимать память.
Слайды 15–20, 32–34Общий энкодер и отдельные головы
CLIP извлекает признаки изображения один раз. Маленькие бинарные классификаторы — головы — проверяют разные нарушения. В Triton объединены предобработка, общий энкодер и головы.

Слайд 45: общий энкодер и несколько голов.
Источник: Wildberries
Слайд 47: сравнение расхода GPU-памяти.
Источник: WildberriesПеред включением проверяют нагрузку
ClearML обучает и конвертирует модель. Проверка на историческом потоке показывает ожидаемые срабатывания; пороги задают в админке. Дополнительный LLM-ассесор перепроверяет результаты, пограничные случаи передают человеку.

Слайд 65: решение о дополнительной ручной проверке.
Источник: WildberriesЧто изменилось и что ещё планируют
Голова занимает в среднем 15 МБ; разработка новой модели сократилась до недели. Дообучение общего энкодера на контенте Wildberries и автоматическое переобучение всех голов — планы. Разбор основан на полной презентации, не на расшифровке видео.

Слайд 51: изменение процесса разработки.
Источник: Wildberries