ВТБLLM3 мин

Как мы дистиллировали Qwen для автоматического протоколирования совещаний

Команда ВТБ составляет протоколы совещаний с помощью Qwen и оптимизирует работу модели, сохраняя качество. Причина оптимизации: исходной 32B требовалось 80 ГБ видеопамяти, а в рабочей системе — A100 на 40 ГБ.

Статья · на русском

Как мы дистиллировали Qwen для автоматического протоколирования совещаний

Андрей Ситников, Максим Шкут · Опубликовано: 28 октября 2025 г.

Обложка исходной статьи ВТБ об автоматическом протоколировании встреч.

Обложка исходной статьи ВТБ об автоматическом протоколировании встреч.

Источник: ВТБ

Задача протоколирования

Протокол помогает восстановить содержание встречи без повторного прослушивания. Система ВТБ распознаёт речь через Wav2Vec 2.0 и передаёт стенограмму в Qwen 2.5 Instruct. Модель выбрали за работу с длинным контекстом, инструкциями и ошибками распознавания.

На выходе распознавания уже есть таймкоды, разделение по говорящим и нормализованный текст. Разделение реплик между участниками встроено в систему видеосвязи. Qwen должна превратить эту стенограмму в структурированный JSON, пригодный для чтения и дальнейшей обработки.

  • Общий протокол: тип встречи, название, содержание, хэштеги, выводы.
  • Хронологический протокол: дополнительно описания сегментов с таймкодами.
Читать в оригинале

Почему понадобилась оптимизация

Качество 32B устраивало команду. Ограничением стала память: требовалось 80 ГБ, тогда как доступные A100 имели 40 ГБ. Нужно было уменьшить затраты без потери качества.

Читать в оригинале

Какие варианты сравнивали

  • Qwen 2.5 14B.
  • Qwen 2.5 32B с AWQ INT4.
  • Qwen 2.5 32B со SmoothQuant INT8.

Два варианта уменьшают точность хранения чисел в большой модели. AWQ учитывает активации при выборе того, как сжать веса, и требует калибровки; не все слои одинаково подходят для такого преобразования. SmoothQuant перераспределяет масштаб между весами и активациями, чтобы уменьшить влияние выбросов, но требует изменений в модели. Третий вариант — обучить меньшую модель на ответах большой.

Читать в оригинале

Данные и обучение

Подготовили более 4000 стенограмм и 8000 обучающих пар с протоколами от Qwen 32B; структуру нормализовали, ошибки распознавания исправили. Для 14B использовали LoRA, для квантизованных вариантов — QLoRA.

Здесь дистилляция означает передачу поведения через примеры: большая Qwen 32B составляет эталонные протоколы, на которых учится более экономичная модель. LoRA обучает небольшие добавочные матрицы при замороженных исходных весах; QLoRA совмещает такой подход со сжатыми весами.

Читать в оригинале

Как оценивали результат

Содержание протоколов переводили в векторы через Universal Sentence Encoder и измеряли их косинусную близость к эталону. Это оценка сходства текстов; правильность деталей проверяли вручную. Температура генерации — 0.

Результаты из таблицы ВТБ. Объём работы для измерения времени авторы не уточняют.
Результаты из таблицы ВТБ. Объём работы для измерения времени авторы не уточняют.
МодельДо обученияПосле обученияВремя, мин
Qwen 14B81,486,722
Qwen 32B · AWQ86,888,020
Qwen 32B · SmoothQuant INT886,889,243

Таблицу можно прокрутить по горизонтали.

Читать в оригинале

Ручная проверка и выбор модели

SmoothQuant лидировала по метрике, но работала дольше без заметной содержательной выгоды. AWQ иногда искажала смысл. 14B лучше сохраняла детали, таймкоды и хэштеги — в том числе полезную информацию, отсутствовавшую в эталоне. Её выбрали для рабочей системы; ручную проверку сохранили.

Например, меньшая модель может включить тему, которая действительно прозвучала на встрече, но была пропущена в эталонном протоколе. Автоматическая близость к эталону от этого снижается, хотя для читателя протокол становится полнее. Поэтому решение о переходе на 14B опиралось и на ручной разбор. Проверку стиля и структуры дополнительными метриками авторы пока только планируют.

Читать в оригинале