RAG или дообучение: сравнение на одной рабочей задаче
RAG и дообучение часто ставят рядом как два способа «научить» модель работать с внутренними материалами. Но у них разные точки приложения. RAG подбирает фрагменты из вашей базы во время запроса и передаёт их модели в контексте. Fine-tuning меняет поведение модели на заранее подготовленных примерах. Поэтому вопрос «что лучше» без описания задачи вводит в заблуждение: свежий регламент и устойчивый стиль ответа требуют разных решений.
Ниже — сравнение на одном сценарии: служба поддержки отвечает на вопросы о доставке, возврате и гарантии. У нас есть 400 страниц регламентов, часть из них меняется каждый месяц, а оператор обязан показать основание ответа. Методика специально отделяет доступ к знаниям от манеры общения.
Как проводили сравнение
Для обоих подходов подготовьте одинаковый набор из 30 вопросов. Включите простые запросы, вопросы на стыке двух правил, устаревший пункт и случай, на который в документах нет ответа. Для каждого вопроса заранее запишите ожидаемый источник, обязательные оговорки и допустимый вариант отказа.
Оцените пять параметров по шкале от 1 до 5:
- точность фактов и чисел;
- способность сослаться на нужный фрагмент;
- устойчивость формата ответа;
- скорость обновления правил;
- объём ручной проверки.
Одинаковая модель и одинаковый системный промпт обязательны. В варианте RAG меняется только индекс документов. В варианте fine-tuning меняются только обучающие примеры; сами регламенты в запрос не прикладываются, иначе мы сравним гибридную схему с чистым поиском.
Что получилось по свойствам
| Критерий | RAG | Fine-tuning |
|---|---|---|
| Новое правило | Достаточно переиндексировать файл | Нужно готовить новые примеры и запускать обучение заново |
| Ссылка на основание | Можно вернуть найденный фрагмент и страницу | Не гарантируется без дополнительного механизма поиска |
| Стиль и тон | Настраивается промптом и шаблоном | Хорошо закрепляется на повторяющихся примерах |
| Ошибка в документе | Видна в источнике, её можно быстро заменить | Может закрепиться в весах до следующего обучения |
| Запуск | Нужен индекс, разбиение и проверка поиска | Нужен датасет, оценка качества и бюджет обучения |
| Риск утечки | В запрос попадает найденный фрагмент | Обучающие данные сложнее отозвать после запуска |
Таблица описывает типичные свойства подходов, а не обещает одинаковые баллы для любого сервиса. В реальном тесте рядом с оценкой сохраняйте конкретную ошибку: модель нашла не ту версию правила, потеряла условие «только для юридических лиц» или ответила без основания.
Когда выигрывает RAG
Выбирайте RAG, если знания часто меняются, их нужно показывать оператору или клиенту и вы хотите удалить документ без переобучения. Качество здесь начинается не с модели, а с подготовки источников: разбейте регламент по смысловым разделам, сохраните заголовок, дату и номер версии, удалите дубли. Поиск должен возвращать не просто похожий абзац, а фрагмент с достаточным контекстом.
Проверьте отдельно вопросы без ответа. Хороший процесс позволяет модели сказать «в базе нет подтверждения» и передать запрос человеку. Если система всегда формулирует уверенный ответ, проблема не в недостаточной креативности, а в отсутствии правила отказа. О принципе такой проверки можно дополнительно прочитать в гайде по проверке ответов нейросети.
Когда оправдано дообучение
Fine-tuning уместен, когда факты относительно стабильны, зато важны повторяемый формат, терминология или последовательность действий. Например, нужно превращать заметку оператора в структурированную запись из шести полей или отвечать в стиле утверждённого сценария. Дообучение не является надёжным хранилищем прайса и регламента: модель может воспроизвести старое значение, даже если бизнес уже его изменил.
До запуска соберите разнообразные примеры: хорошие ответы, корректные отказы, пограничные вопросы и явно запрещённые действия. Разделите данные на обучение и проверку, чтобы не принять запоминание за качество. После обучения прогоните тот же набор из 30 вопросов и сравните не только среднюю оценку, но и самые опасные ошибки.
Часто разумен гибрид
В службе поддержки практичная схема выглядит так: RAG поставляет актуальный фрагмент политики, а дообученная или тщательно настроенная модель приводит его к единому формату. При этом запрет на действие и обязанность показать источник задаются отдельными правилами приложения, а не надеждой на память модели. Такой дизайн сложнее, зато каждая часть имеет измеримую роль.
Перед выбором ответьте на четыре вопроса:
- Меняются ли исходные документы чаще, чем раз в квартал?
- Должен ли пользователь увидеть основание ответа?
- Нужна ли строгая форма, одинаковая в каждом результате?
- Можно ли безопасно удалить или отозвать обучающие примеры?
Первые два ответа «да» тянут к RAG, третий — к дообучению, а при сочетании всех трёх требований обычно нужен гибрид. Если документы содержат персональные данные, сначала примените локальную проверку и маскирование, а уже потом решайте, где хранить индекс или датасет.
Как посчитать цену изменения правила
Возьмите один пункт регламента, который меняется каждый месяц, и проведите его через оба контура. Для RAG запишите время правки файла, переиндексации и контрольного вопроса. Для fine-tuning добавьте подготовку примеров, обучение, проверку и окно, пока старая версия ещё может отвечать пользователям. Получится не абстрактная цена технологии, а стоимость конкретного изменения, которое бизнесу придётся повторять.
Затем измерьте период двойной работы. Пока новая версия fine-tuning проверяется, часть вопросов нужно отправлять на ручную сверку; в RAG такой период может быть короче, но возрастает риск неудачного поиска. В журнале отметьте, сколько ответов пришлось остановить, сколько операторов участвовало и какие ошибки повторялись. Эти данные часто меняют решение сильнее, чем разница в цене обучения.
Если планируете гибрид, разделите ответственность в документации: RAG отвечает за актуальный источник, fine-tuning — за формат, а приложение — за права и отказ. При изменении регламента обновляйте только соответствующий слой и запускайте минимальный контрольный набор. Такая граница не даёт команде «лечить» устаревший документ новым дообучением.
Итог проверки
Не выбирайте технологию по названию и демонстрационному ответу. Возьмите одну реальную задачу, зафиксируйте вопросы, источники и критерии, проведите одинаковый прогон и разберите ошибки вручную. RAG лучше отвечает за актуальность и объяснимость знаний; fine-tuning — за устойчивое поведение и формат. Победителем становится не один метод, а тот вариант, чьи ошибки вы умеете обнаружить, исправить и повторно измерить.