ИИ ИИшка Про
Гайды

Что такое синтетические данные: можно ли учить нейросеть на выдумке

AI-редакция

Звучит как парадокс: нейросеть учится на текстах, которые написала другая нейросеть. Тем не менее это уже стандартная практика, и часть свежих моделей без неё бы не появилась. Разбираемся, почему так вышло и где здесь подвох.

Что это такое

Синтетические данные — это обучающие примеры, созданные искусственно, а не собранные из реального мира.

Три основных способа их получить:

  1. Сгенерировать моделью. Сильная модель пишет тысячи примеров задач с решениями, на них учат модель поменьше. Это близкий родственник дистилляции.
  2. Сгенерировать программой. Для математики и кода это особенно удобно: пример можно построить по правилам, а правильность — проверить автоматически, запустив код или сверив вычисление.
  3. Размножить реальные данные. Взять настоящий набор и получить из него вариации: перефразировать текст, повернуть картинку, заменить имена.

Зачем это понадобилось

Причины сугубо практические, и их три.

Качественные тексты кончаются. Интернет большой, но пригодного для обучения текста в нём конечное количество, и лучшую его часть уже вычерпали. Дальше — либо мусор, либо то, что нельзя использовать по лицензии.

Реальные данные юридически опасны. Обучение на чужих книгах, статьях и коде — предмет судебных разбирательств по всему миру. Сгенерированные примеры этой проблемы лишены.

Персональные данные нельзя брать вообще. Медицина, финансы, кадры — области, где настоящие данные закрыты законом. Синтетический набор с той же статистикой, но без живых людей, эту стену обходит легально.

Отдельный случай — редкие ситуации. Чтобы модель научилась распознавать нештатную ситуацию, нужны примеры. В реальности их по определению мало, а сгенерировать можно сколько угодно.

Где это работает хорошо

Закономерность простая: синтетика хороша там, где ответ можно проверить.

  • Код. Сгенерировали задачу и решение — запустили тесты. Прошли тесты, значит пример корректный.
  • Математика. То же самое: ответ либо сходится, либо нет.
  • Формальные преобразования. Перевод между форматами, извлечение полей, структурирование.

Именно поэтому прогресс моделей в коде и математике идёт быстрее, чем, скажем, в понимании человеческих мотивов: первое можно автоматически проверять и наращивать бесконечно, второе — нет.

Где начинаются проблемы

Коллапс модели — главный риск и самый обсуждаемый. Если учить модель на выводе предыдущей модели, потом следующую — на выводе этой, и так по кругу, качество деградирует. Редкие явления из данных вымываются, разнообразие падает, ответы становятся всё более усреднёнными и однообразными.

Аналогия: это как многократно копировать копию. Каждая итерация вроде бы похожа на оригинал, но артефакты накапливаются, а детали исчезают безвозвратно.

Наследование ошибок. Модель-учитель передаёт ученику не только знания, но и свои заблуждения — причём в концентрированном виде. Ошибка, которая у учителя была редкой, у ученика может стать системной.

Ложное разнообразие. Сто тысяч сгенерированных примеров выглядят как большой набор данных, но если все они получены одной моделью с похожими промптами, реального разнообразия там куда меньше, чем кажется по объёму.

Отсюда практическое правило отрасли: синтетика идёт в дополнение к реальным данным, а не вместо них. Полностью синтетический цикл обучения — прямая дорога к коллапсу.

Как это касается вас

Три момента, которые важны и без обучения собственных моделей.

Ответы моделей становятся более похожими друг на друга. Если разные модели учились на пересекающихся синтетических наборах, их стиль и подход сближаются. Отчасти поэтому текст, написанный нейросетью, стало легче узнавать — по характерным штампам.

Синтетика — законный инструмент и для вас. Нужно протестировать программу или показать таблицу коллеге, но данные настоящие и чувствительные? Сгенерируйте похожий набор вместо того, чтобы обезличивать реальный. Это надёжнее: обезличенные данные иногда удаётся восстановить, а выдуманные восстанавливать нечего. Для этого есть генератор тестовых данных.

«Обучено на 10 триллионах токенов» — не показатель качества. Важно не сколько данных, а какие. Как читать подобные заявления — в гайде про бенчмарки.

Что запомнить

  • Синтетические данные — созданные искусственно, а не собранные из реального мира.
  • Причины: качественные тексты кончаются, реальные данные юридически рискованны, персональные — запрещены.
  • Работают лучше всего там, где ответ можно проверить автоматически: код, математика.
  • Главный риск — коллапс модели: обучение на выводе моделей по кругу вымывает разнообразие.
  • Модель-учитель передаёт ученику и свои ошибки.
  • Правило: в дополнение к реальным данным, не вместо них.
  • Для вас лично это удобный способ не использовать чувствительные данные в тестах и демонстрациях.