ИИ ИИшка Про
Обзоры

RAG или дообучение: сравнение на одной рабочей задаче

AI-редакция

RAG и дообучение часто ставят рядом как два способа «научить» модель работать с внутренними материалами. Но у них разные точки приложения. RAG подбирает фрагменты из вашей базы во время запроса и передаёт их модели в контексте. Fine-tuning меняет поведение модели на заранее подготовленных примерах. Поэтому вопрос «что лучше» без описания задачи вводит в заблуждение: свежий регламент и устойчивый стиль ответа требуют разных решений.

Ниже — сравнение на одном сценарии: служба поддержки отвечает на вопросы о доставке, возврате и гарантии. У нас есть 400 страниц регламентов, часть из них меняется каждый месяц, а оператор обязан показать основание ответа. Методика специально отделяет доступ к знаниям от манеры общения.

Как проводили сравнение

Для обоих подходов подготовьте одинаковый набор из 30 вопросов. Включите простые запросы, вопросы на стыке двух правил, устаревший пункт и случай, на который в документах нет ответа. Для каждого вопроса заранее запишите ожидаемый источник, обязательные оговорки и допустимый вариант отказа.

Оцените пять параметров по шкале от 1 до 5:

  • точность фактов и чисел;
  • способность сослаться на нужный фрагмент;
  • устойчивость формата ответа;
  • скорость обновления правил;
  • объём ручной проверки.

Одинаковая модель и одинаковый системный промпт обязательны. В варианте RAG меняется только индекс документов. В варианте fine-tuning меняются только обучающие примеры; сами регламенты в запрос не прикладываются, иначе мы сравним гибридную схему с чистым поиском.

Что получилось по свойствам

КритерийRAGFine-tuning
Новое правилоДостаточно переиндексировать файлНужно готовить новые примеры и запускать обучение заново
Ссылка на основаниеМожно вернуть найденный фрагмент и страницуНе гарантируется без дополнительного механизма поиска
Стиль и тонНастраивается промптом и шаблономХорошо закрепляется на повторяющихся примерах
Ошибка в документеВидна в источнике, её можно быстро заменитьМожет закрепиться в весах до следующего обучения
ЗапускНужен индекс, разбиение и проверка поискаНужен датасет, оценка качества и бюджет обучения
Риск утечкиВ запрос попадает найденный фрагментОбучающие данные сложнее отозвать после запуска

Таблица описывает типичные свойства подходов, а не обещает одинаковые баллы для любого сервиса. В реальном тесте рядом с оценкой сохраняйте конкретную ошибку: модель нашла не ту версию правила, потеряла условие «только для юридических лиц» или ответила без основания.

Когда выигрывает RAG

Выбирайте RAG, если знания часто меняются, их нужно показывать оператору или клиенту и вы хотите удалить документ без переобучения. Качество здесь начинается не с модели, а с подготовки источников: разбейте регламент по смысловым разделам, сохраните заголовок, дату и номер версии, удалите дубли. Поиск должен возвращать не просто похожий абзац, а фрагмент с достаточным контекстом.

Проверьте отдельно вопросы без ответа. Хороший процесс позволяет модели сказать «в базе нет подтверждения» и передать запрос человеку. Если система всегда формулирует уверенный ответ, проблема не в недостаточной креативности, а в отсутствии правила отказа. О принципе такой проверки можно дополнительно прочитать в гайде по проверке ответов нейросети.

Когда оправдано дообучение

Fine-tuning уместен, когда факты относительно стабильны, зато важны повторяемый формат, терминология или последовательность действий. Например, нужно превращать заметку оператора в структурированную запись из шести полей или отвечать в стиле утверждённого сценария. Дообучение не является надёжным хранилищем прайса и регламента: модель может воспроизвести старое значение, даже если бизнес уже его изменил.

До запуска соберите разнообразные примеры: хорошие ответы, корректные отказы, пограничные вопросы и явно запрещённые действия. Разделите данные на обучение и проверку, чтобы не принять запоминание за качество. После обучения прогоните тот же набор из 30 вопросов и сравните не только среднюю оценку, но и самые опасные ошибки.

Часто разумен гибрид

В службе поддержки практичная схема выглядит так: RAG поставляет актуальный фрагмент политики, а дообученная или тщательно настроенная модель приводит его к единому формату. При этом запрет на действие и обязанность показать источник задаются отдельными правилами приложения, а не надеждой на память модели. Такой дизайн сложнее, зато каждая часть имеет измеримую роль.

Перед выбором ответьте на четыре вопроса:

  1. Меняются ли исходные документы чаще, чем раз в квартал?
  2. Должен ли пользователь увидеть основание ответа?
  3. Нужна ли строгая форма, одинаковая в каждом результате?
  4. Можно ли безопасно удалить или отозвать обучающие примеры?

Первые два ответа «да» тянут к RAG, третий — к дообучению, а при сочетании всех трёх требований обычно нужен гибрид. Если документы содержат персональные данные, сначала примените локальную проверку и маскирование, а уже потом решайте, где хранить индекс или датасет.

Как посчитать цену изменения правила

Возьмите один пункт регламента, который меняется каждый месяц, и проведите его через оба контура. Для RAG запишите время правки файла, переиндексации и контрольного вопроса. Для fine-tuning добавьте подготовку примеров, обучение, проверку и окно, пока старая версия ещё может отвечать пользователям. Получится не абстрактная цена технологии, а стоимость конкретного изменения, которое бизнесу придётся повторять.

Затем измерьте период двойной работы. Пока новая версия fine-tuning проверяется, часть вопросов нужно отправлять на ручную сверку; в RAG такой период может быть короче, но возрастает риск неудачного поиска. В журнале отметьте, сколько ответов пришлось остановить, сколько операторов участвовало и какие ошибки повторялись. Эти данные часто меняют решение сильнее, чем разница в цене обучения.

Если планируете гибрид, разделите ответственность в документации: RAG отвечает за актуальный источник, fine-tuning — за формат, а приложение — за права и отказ. При изменении регламента обновляйте только соответствующий слой и запускайте минимальный контрольный набор. Такая граница не даёт команде «лечить» устаревший документ новым дообучением.

Итог проверки

Не выбирайте технологию по названию и демонстрационному ответу. Возьмите одну реальную задачу, зафиксируйте вопросы, источники и критерии, проведите одинаковый прогон и разберите ошибки вручную. RAG лучше отвечает за актуальность и объяснимость знаний; fine-tuning — за устойчивое поведение и формат. Победителем становится не один метод, а тот вариант, чьи ошибки вы умеете обнаружить, исправить и повторно измерить.

Обзоры Auto-0.4B-2: карточка длинноконтекстного классификатора для проверки запросов агента Компактная модель на ModernBERT классифицирует инструкции и длинные контексты до 65 536 токенов. Разбираем назначение, ограничения авторского теста и безопасный путь проверки. Обзоры ESMC-AR 848M + PLE: карточка авторегрессионной модели для белковых последовательностей Открытая исследовательская модель предсказывает следующий аминокислотный токен и добавляет крупные n-граммные представления на каждом слое. Что в ней подтверждено и чего модельная карточка пока не доказывает. Обзоры Microsoft FSQ: обзор каркаса, который требует доказательства каждого действия ИИ-агента FSQ записывает шаги UI-автоматизации как проверяемые артефакты для веба, мобильных и настольных приложений. Разбираем архитектуру, сильные стороны и цену такой дисциплины. Обзоры Одна голосовая модель или связка с task-агентом: сравнение архитектур без магии Сопоставляем монолитный speech-to-speech контур и архитектуру, где разговор отделён от выполнения задач: задержка, перебивания, контроль, журналы и стоимость.
Опубликовано: 20 августа 03:05
← На главную