Что такое дистилляция моделей и почему маленькая нейросеть работает как большая
Вы наверняка замечали: у моделей выходят версии «mini», «nano», «flash», «lite» — и они работают почти так же, как старшие, но в разы дешевле и быстрее. Чаще всего за этим стоит дистилляция.
Суть в одной аналогии
Есть профессор, который знает предмет глубоко, но консультация у него стоит дорого и занимает много времени. Есть студент — быстрый и дешёвый, но знает мало.
Дистилляция — это когда профессор обучает студента. Не по учебнику, а показывая на конкретных задачах: вот вопрос, вот мой ответ, вот почему я ответил именно так. Студент никогда не станет профессором, но научится решать типовые задачи почти так же — и делать это в разы быстрее.
В терминах ИИ: большая модель называется учителем (teacher), маленькая — учеником (student).
Что именно передаётся
Ключевая деталь, из-за которой всё работает. Обычная модель учится на текстах: «правильный ответ — вот этот». Ученик при дистилляции учится на распределении вероятностей учителя.
Разница на примере. Вопрос: «Столица Франции — …». Обычное обучение говорит только: правильный ответ «Париж». Учитель же выдаёт нечто вроде:
| Вариант | Вероятность у учителя |
|---|---|
| Париж | 0,92 |
| Лион | 0,04 |
| Марсель | 0,03 |
| Берлин | 0,01 |
Ученик видит не только правильный ответ, но и как учитель оценивает неправильные. Из этого он узнаёт, что Лион и Марсель — тоже французские города (близкие варианты), а Берлин — совсем не то. Такой сигнал гораздо богаче простого «правильно/неправильно», поэтому ученик учится быстрее и на меньшем объёме данных.
Дистилляция ≠ квантизация ≠ обрезка
Три способа уменьшить модель постоянно путают. Разница принципиальная:
| Метод | Что делает | Аналогия |
|---|---|---|
| Дистилляция | Обучает новую, меньшую модель повторять поведение большой | Учитель готовит ученика |
| Квантизация | Огрубляет числа в той же модели (16 бит → 4 бита) | Книгу печатают мелким шрифтом |
| Прунинг (обрезка) | Удаляет из той же модели малозначимые связи | Из книги вырывают лишние страницы |
Дистилляция — единственный из трёх, где на выходе получается другая модель, а не изменённая старая. Поэтому её можно комбинировать с остальными: сначала дистиллировать, потом квантизовать.
Кстати, комбинированный подход уже стал стандартом. В свежей Nemotron 3 Embed от NVIDIA применена Quantization-Aware Distillation — модель дистиллируют сразу с учётом того, что её потом сожмут до 4 бит. Это позволяет вернуть точность, которая при обычном сжатии теряется на длинных текстах.
Цифры: сколько теряется
Дистилляция — это всегда размен. Реальный пример из той же линейки NVIDIA:
| Версия | Параметров | Результат на RTEB | Размерность векторов |
|---|---|---|---|
| Nemotron 3 Embed 8B | 8 млрд | 78,5% | 4096 |
| Nemotron 3 Embed 1B | 1,14 млрд | 72,4% | 2048 |
Модель в 7 раз меньше теряет около 6 процентных пунктов качества. Для многих задач это отличная сделка: меньше памяти, быстрее ответ, дешевле железо. Для задач, где важна точность на пределе, — нет.
Общее правило: ученик почти всегда хуже учителя. Дистилляция сжимает разрыв, но не устраняет его. Заявления в духе «наша модель на 7B не хуже 70B» стоит читать с оговоркой «на этом наборе тестов».
Спорная сторона: чужие модели как учитель
Здесь тема становится юридической. Дистиллировать можно не только свою модель, но и чужую — генерируя ответы через API конкурента и обучая на них свою.
Именно из-за этого регулярно вспыхивают скандалы. Условия использования большинства коммерческих моделей прямо запрещают обучать на их выводах конкурирующие модели. Доказать нарушение сложно: ответы не помечены, а стилистическое сходство — не улика.
История с моделью Inkling от Thinking Machines показательна: компания подтвердила, что для генерации части данных перед основным обучением использовала другие открытые модели, включая Kimi. Отрасли пришлось обсуждать, где проходит граница между «учились на открытых данных» и «скопировали конкурента».
Зачем это знать пользователю
Три практических вывода.
Версии mini и flash — это не «обрезанные» модели. Они обучены отдельно и часто оптимальны по соотношению цена/качество. Выбирать флагман по умолчанию — переплачивать. Подобрать модель под задачу поможет подборщик моделей, а прикинуть разницу в счетах — калькулятор стоимости.
Маленькая модель на своём железе стала реальной. Дистилляция — главная причина, почему локальный запуск перестал быть уделом энтузиастов с дорогими видеокартами. Особенно это важно сейчас, когда память резко подорожала.
Скепсис к громким заголовкам полезен. Если модель в 10 раз меньше объявлена «сопоставимой с флагманом», смотрите, на каких именно задачах. Как читать такие заявления — в гайде про бенчмарки.
Что запомнить
- Дистилляция — обучение маленькой модели повторять поведение большой.
- Ученик учится на распределении вероятностей учителя, а не только на правильных ответах — сигнал богаче.
- Это не квантизация и не обрезка: на выходе новая модель, а не изменённая старая.
- Качество почти всегда падает: −6 п.п. при семикратном уменьшении в примере выше.
- Дистилляция с чужой модели — юридически спорная практика, запрещённая большинством лицензий.
- Для пользователя это означает: версии mini часто выгоднее флагманов.