ИИ ИИшка Про
Гайды

Что такое RAG (Retrieval-Augmented Generation) простыми словами

AI-редакция

Вы наверняка слышали аббревиатуру RAG в разговорах про чат-боты по документам и корпоративный ИИ. Разберём простыми словами, что это и зачем.

Что такое RAG

RAG (Retrieval-Augmented Generation, «генерация с поиском») — это подход, при котором нейросеть перед ответом сначала ищет нужную информацию во внешней базе знаний, а потом отвечает, опираясь на найденное. То есть модель отвечает не только «из головы» (из того, что выучила при обучении), а сверяясь с вашими актуальными данными.

Как это работает (по шагам)

  1. Ваши документы заранее разбивают на куски и превращают в векторы (числовые «отпечатки» смысла) — это называется embeddings.
  2. Когда вы задаёте вопрос, система находит в базе самые подходящие по смыслу куски.
  3. Эти куски подставляются в промпт вместе с вашим вопросом.
  4. Нейросеть формирует ответ уже на основе найденного контекста — и часто даёт ссылки на источник.

Зачем нужен RAG

  • Свежие и свои данные. Модель «знает» только то, что было до её обучения. RAG позволяет подключить актуальную информацию и закрытые документы компании.
  • Меньше галлюцинаций. Когда ответ опирается на конкретный источник, выдумок меньше. Подробнее про выдумки — в гайде как проверять ответы и не попасться на галлюцинации.
  • Прозрачность. Можно показать, из какого документа взят ответ.

RAG или дообучение (fine-tuning)?

  • RAG — подключает знания «на лету», ничего не переобучая. Легко обновлять (просто меняете документы). Идеален для базы знаний, поддержки, поиска по документам.
  • Дообучение — меняет саму модель под стиль/задачу, но это дороже и сложнее обновлять.

Для большинства задач «ответить по нашим документам» выбирают именно RAG.

Где вы это встречаете

Чат-боты по базе знаний, поиск по корпоративным документам, ассистенты с ссылками на источники, функции вроде «спросить у PDF». Многие современные модели с большим контекстным окном и так неплохо работают с документами — но RAG нужен, когда данных больше, чем влезает в один запрос, или когда их много и они меняются.

Коротко

RAG = поиск по вашим данным + ответ нейросети на их основе. Это даёт свежесть, точность и меньше выдумок. Чтобы понимать, сколько данных влезает в модель за раз, пригодится гайд про токены, а выбрать модель под задачу поможет каталог нейросетей.