ИИ ИИшка Про
Гайды

Что такое дистилляция моделей и почему маленькая нейросеть работает как большая

AI-редакция

Вы наверняка замечали: у моделей выходят версии «mini», «nano», «flash», «lite» — и они работают почти так же, как старшие, но в разы дешевле и быстрее. Чаще всего за этим стоит дистилляция.

Суть в одной аналогии

Есть профессор, который знает предмет глубоко, но консультация у него стоит дорого и занимает много времени. Есть студент — быстрый и дешёвый, но знает мало.

Дистилляция — это когда профессор обучает студента. Не по учебнику, а показывая на конкретных задачах: вот вопрос, вот мой ответ, вот почему я ответил именно так. Студент никогда не станет профессором, но научится решать типовые задачи почти так же — и делать это в разы быстрее.

В терминах ИИ: большая модель называется учителем (teacher), маленькая — учеником (student).

Что именно передаётся

Ключевая деталь, из-за которой всё работает. Обычная модель учится на текстах: «правильный ответ — вот этот». Ученик при дистилляции учится на распределении вероятностей учителя.

Разница на примере. Вопрос: «Столица Франции — …». Обычное обучение говорит только: правильный ответ «Париж». Учитель же выдаёт нечто вроде:

ВариантВероятность у учителя
Париж0,92
Лион0,04
Марсель0,03
Берлин0,01

Ученик видит не только правильный ответ, но и как учитель оценивает неправильные. Из этого он узнаёт, что Лион и Марсель — тоже французские города (близкие варианты), а Берлин — совсем не то. Такой сигнал гораздо богаче простого «правильно/неправильно», поэтому ученик учится быстрее и на меньшем объёме данных.

Дистилляция ≠ квантизация ≠ обрезка

Три способа уменьшить модель постоянно путают. Разница принципиальная:

МетодЧто делаетАналогия
ДистилляцияОбучает новую, меньшую модель повторять поведение большойУчитель готовит ученика
КвантизацияОгрубляет числа в той же модели (16 бит → 4 бита)Книгу печатают мелким шрифтом
Прунинг (обрезка)Удаляет из той же модели малозначимые связиИз книги вырывают лишние страницы

Дистилляция — единственный из трёх, где на выходе получается другая модель, а не изменённая старая. Поэтому её можно комбинировать с остальными: сначала дистиллировать, потом квантизовать.

Кстати, комбинированный подход уже стал стандартом. В свежей Nemotron 3 Embed от NVIDIA применена Quantization-Aware Distillation — модель дистиллируют сразу с учётом того, что её потом сожмут до 4 бит. Это позволяет вернуть точность, которая при обычном сжатии теряется на длинных текстах.

Цифры: сколько теряется

Дистилляция — это всегда размен. Реальный пример из той же линейки NVIDIA:

ВерсияПараметровРезультат на RTEBРазмерность векторов
Nemotron 3 Embed 8B8 млрд78,5%4096
Nemotron 3 Embed 1B1,14 млрд72,4%2048

Модель в 7 раз меньше теряет около 6 процентных пунктов качества. Для многих задач это отличная сделка: меньше памяти, быстрее ответ, дешевле железо. Для задач, где важна точность на пределе, — нет.

Общее правило: ученик почти всегда хуже учителя. Дистилляция сжимает разрыв, но не устраняет его. Заявления в духе «наша модель на 7B не хуже 70B» стоит читать с оговоркой «на этом наборе тестов».

Спорная сторона: чужие модели как учитель

Здесь тема становится юридической. Дистиллировать можно не только свою модель, но и чужую — генерируя ответы через API конкурента и обучая на них свою.

Именно из-за этого регулярно вспыхивают скандалы. Условия использования большинства коммерческих моделей прямо запрещают обучать на их выводах конкурирующие модели. Доказать нарушение сложно: ответы не помечены, а стилистическое сходство — не улика.

История с моделью Inkling от Thinking Machines показательна: компания подтвердила, что для генерации части данных перед основным обучением использовала другие открытые модели, включая Kimi. Отрасли пришлось обсуждать, где проходит граница между «учились на открытых данных» и «скопировали конкурента».

Зачем это знать пользователю

Три практических вывода.

Версии mini и flash — это не «обрезанные» модели. Они обучены отдельно и часто оптимальны по соотношению цена/качество. Выбирать флагман по умолчанию — переплачивать. Подобрать модель под задачу поможет подборщик моделей, а прикинуть разницу в счетах — калькулятор стоимости.

Маленькая модель на своём железе стала реальной. Дистилляция — главная причина, почему локальный запуск перестал быть уделом энтузиастов с дорогими видеокартами. Особенно это важно сейчас, когда память резко подорожала.

Скепсис к громким заголовкам полезен. Если модель в 10 раз меньше объявлена «сопоставимой с флагманом», смотрите, на каких именно задачах. Как читать такие заявления — в гайде про бенчмарки.

Что запомнить

  • Дистилляция — обучение маленькой модели повторять поведение большой.
  • Ученик учится на распределении вероятностей учителя, а не только на правильных ответах — сигнал богаче.
  • Это не квантизация и не обрезка: на выходе новая модель, а не изменённая старая.
  • Качество почти всегда падает: −6 п.п. при семикратном уменьшении в примере выше.
  • Дистилляция с чужой модели — юридически спорная практика, запрещённая большинством лицензий.
  • Для пользователя это означает: версии mini часто выгоднее флагманов.