Что такое синтетические данные: можно ли учить нейросеть на выдумке
Звучит как парадокс: нейросеть учится на текстах, которые написала другая нейросеть. Тем не менее это уже стандартная практика, и часть свежих моделей без неё бы не появилась. Разбираемся, почему так вышло и где здесь подвох.
Что это такое
Синтетические данные — это обучающие примеры, созданные искусственно, а не собранные из реального мира.
Три основных способа их получить:
- Сгенерировать моделью. Сильная модель пишет тысячи примеров задач с решениями, на них учат модель поменьше. Это близкий родственник дистилляции.
- Сгенерировать программой. Для математики и кода это особенно удобно: пример можно построить по правилам, а правильность — проверить автоматически, запустив код или сверив вычисление.
- Размножить реальные данные. Взять настоящий набор и получить из него вариации: перефразировать текст, повернуть картинку, заменить имена.
Зачем это понадобилось
Причины сугубо практические, и их три.
Качественные тексты кончаются. Интернет большой, но пригодного для обучения текста в нём конечное количество, и лучшую его часть уже вычерпали. Дальше — либо мусор, либо то, что нельзя использовать по лицензии.
Реальные данные юридически опасны. Обучение на чужих книгах, статьях и коде — предмет судебных разбирательств по всему миру. Сгенерированные примеры этой проблемы лишены.
Персональные данные нельзя брать вообще. Медицина, финансы, кадры — области, где настоящие данные закрыты законом. Синтетический набор с той же статистикой, но без живых людей, эту стену обходит легально.
Отдельный случай — редкие ситуации. Чтобы модель научилась распознавать нештатную ситуацию, нужны примеры. В реальности их по определению мало, а сгенерировать можно сколько угодно.
Где это работает хорошо
Закономерность простая: синтетика хороша там, где ответ можно проверить.
- Код. Сгенерировали задачу и решение — запустили тесты. Прошли тесты, значит пример корректный.
- Математика. То же самое: ответ либо сходится, либо нет.
- Формальные преобразования. Перевод между форматами, извлечение полей, структурирование.
Именно поэтому прогресс моделей в коде и математике идёт быстрее, чем, скажем, в понимании человеческих мотивов: первое можно автоматически проверять и наращивать бесконечно, второе — нет.
Где начинаются проблемы
Коллапс модели — главный риск и самый обсуждаемый. Если учить модель на выводе предыдущей модели, потом следующую — на выводе этой, и так по кругу, качество деградирует. Редкие явления из данных вымываются, разнообразие падает, ответы становятся всё более усреднёнными и однообразными.
Аналогия: это как многократно копировать копию. Каждая итерация вроде бы похожа на оригинал, но артефакты накапливаются, а детали исчезают безвозвратно.
Наследование ошибок. Модель-учитель передаёт ученику не только знания, но и свои заблуждения — причём в концентрированном виде. Ошибка, которая у учителя была редкой, у ученика может стать системной.
Ложное разнообразие. Сто тысяч сгенерированных примеров выглядят как большой набор данных, но если все они получены одной моделью с похожими промптами, реального разнообразия там куда меньше, чем кажется по объёму.
Отсюда практическое правило отрасли: синтетика идёт в дополнение к реальным данным, а не вместо них. Полностью синтетический цикл обучения — прямая дорога к коллапсу.
Как это касается вас
Три момента, которые важны и без обучения собственных моделей.
Ответы моделей становятся более похожими друг на друга. Если разные модели учились на пересекающихся синтетических наборах, их стиль и подход сближаются. Отчасти поэтому текст, написанный нейросетью, стало легче узнавать — по характерным штампам.
Синтетика — законный инструмент и для вас. Нужно протестировать программу или показать таблицу коллеге, но данные настоящие и чувствительные? Сгенерируйте похожий набор вместо того, чтобы обезличивать реальный. Это надёжнее: обезличенные данные иногда удаётся восстановить, а выдуманные восстанавливать нечего. Для этого есть генератор тестовых данных.
«Обучено на 10 триллионах токенов» — не показатель качества. Важно не сколько данных, а какие. Как читать подобные заявления — в гайде про бенчмарки.
Что запомнить
- Синтетические данные — созданные искусственно, а не собранные из реального мира.
- Причины: качественные тексты кончаются, реальные данные юридически рискованны, персональные — запрещены.
- Работают лучше всего там, где ответ можно проверить автоматически: код, математика.
- Главный риск — коллапс модели: обучение на выводе моделей по кругу вымывает разнообразие.
- Модель-учитель передаёт ученику и свои ошибки.
- Правило: в дополнение к реальным данным, не вместо них.
- Для вас лично это удобный способ не использовать чувствительные данные в тестах и демонстрациях.