Как мы дистиллировали Qwen для автоматического протоколирования совещаний
Команда ВТБ составляет протоколы совещаний с помощью Qwen и оптимизирует работу модели, сохраняя качество. Причина оптимизации: исходной 32B требовалось 80 ГБ видеопамяти, а в рабочей системе — A100 на 40 ГБ.
Статья · на русском
Как мы дистиллировали Qwen для автоматического протоколирования совещанийАндрей Ситников, Максим Шкут · Опубликовано: 28 октября 2025 г.

Обложка исходной статьи ВТБ об автоматическом протоколировании встреч.
Источник: ВТБЗадача протоколирования
Протокол помогает восстановить содержание встречи без повторного прослушивания. Система ВТБ распознаёт речь через Wav2Vec 2.0 и передаёт стенограмму в Qwen 2.5 Instruct. Модель выбрали за работу с длинным контекстом, инструкциями и ошибками распознавания.
На выходе распознавания уже есть таймкоды, разделение по говорящим и нормализованный текст. Разделение реплик между участниками встроено в систему видеосвязи. Qwen должна превратить эту стенограмму в структурированный JSON, пригодный для чтения и дальнейшей обработки.
- Общий протокол: тип встречи, название, содержание, хэштеги, выводы.
- Хронологический протокол: дополнительно описания сегментов с таймкодами.
Почему понадобилась оптимизация
Качество 32B устраивало команду. Ограничением стала память: требовалось 80 ГБ, тогда как доступные A100 имели 40 ГБ. Нужно было уменьшить затраты без потери качества.
Читать в оригиналеКакие варианты сравнивали
- Qwen 2.5 14B.
- Qwen 2.5 32B с AWQ INT4.
- Qwen 2.5 32B со SmoothQuant INT8.
Два варианта уменьшают точность хранения чисел в большой модели. AWQ учитывает активации при выборе того, как сжать веса, и требует калибровки; не все слои одинаково подходят для такого преобразования. SmoothQuant перераспределяет масштаб между весами и активациями, чтобы уменьшить влияние выбросов, но требует изменений в модели. Третий вариант — обучить меньшую модель на ответах большой.
Читать в оригиналеДанные и обучение
Подготовили более 4000 стенограмм и 8000 обучающих пар с протоколами от Qwen 32B; структуру нормализовали, ошибки распознавания исправили. Для 14B использовали LoRA, для квантизованных вариантов — QLoRA.
Здесь дистилляция означает передачу поведения через примеры: большая Qwen 32B составляет эталонные протоколы, на которых учится более экономичная модель. LoRA обучает небольшие добавочные матрицы при замороженных исходных весах; QLoRA совмещает такой подход со сжатыми весами.
Читать в оригиналеКак оценивали результат
Содержание протоколов переводили в векторы через Universal Sentence Encoder и измеряли их косинусную близость к эталону. Это оценка сходства текстов; правильность деталей проверяли вручную. Температура генерации — 0.
Таблицу можно прокрутить по горизонтали.
Ручная проверка и выбор модели
SmoothQuant лидировала по метрике, но работала дольше без заметной содержательной выгоды. AWQ иногда искажала смысл. 14B лучше сохраняла детали, таймкоды и хэштеги — в том числе полезную информацию, отсутствовавшую в эталоне. Её выбрали для рабочей системы; ручную проверку сохранили.
Например, меньшая модель может включить тему, которая действительно прозвучала на встрече, но была пропущена в эталонном протоколе. Автоматическая близость к эталону от этого снижается, хотя для читателя протокол становится полнее. Поэтому решение о переходе на 14B опиралось и на ручной разбор. Проверку стиля и структуры дополнительными метриками авторы пока только планируют.
Читать в оригинале