Нейросети учатся признавать, когда не знают ответ
У нейросетей есть характерная слабость: столкнувшись с вопросом, на который не знают точного ответа, они не молчат и не сомневаются — а уверенно выдумывают факт, дату или цитату, звучащую абсолютно правдоподобно. Это явление давно называют «галлюцинациями», и оно остаётся одной из главных претензий к ИИ. В последнее время разработчики всё активнее учат модели честно признавать: «я не уверен» или «я не знаю» — вместо того чтобы гладко врать.
Почему модели вообще выдумывают
Языковая модель по своей природе — предсказатель следующего слова, обученный на гигантском массиве текста. Когда её спрашивают о том, чего она толком «не помнит», она всё равно выдаёт наиболее вероятное продолжение — грамматически правильное и уверенно звучащее, но не обязательно верное по фактам. Раньше модели практически не были обучены распознавать границу между «знаю точно» и «предполагаю» — и выдавали оба случая одинаково уверенным тоном.
Что меняется
Разработчики нашли способ научить модели честности через сам процесс обучения: систему поощряют за фразы вроде «точно не уверен, но, вероятно…» и наказывают за уверенные выдумки — даже если те случайно оказались правдой. Это меняет саму «привычку» модели: она начинает оценивать собственную уверенность, а не просто выдавать самый гладкий ответ.
На практике это выглядит так: на редкий факт, дату или узкую тему модель чаще отвечает «не могу утверждать точно» или предлагает проверить источник — вместо того чтобы уверенно назвать неверную цифру.
Почему это важно
Галлюцинации — не мелочь, а причина, по которой ИИ до сих пор нельзя слепо доверять в важных вопросах: медицине, праве, финансах, учёбе. Модель, которая честно говорит «не знаю», объективно менее удобна в моменте — гладкий уверенный ответ приятнее читать. Но она гораздо безопаснее в использовании, потому что не подсовывает выдумку под видом факта.
Это прямой компромисс между удобством и надёжностью, и то, что индустрия смещается в сторону надёжности, — хороший знак для всех, кто использует ИИ в работе.
Что пока не решено
Будем честны — до идеала далеко:
- Совсем избавиться от галлюцинаций пока нельзя. Это снижает их частоту, а не убирает полностью.
- Модели иногда «перестраховываются». Некоторые начинают говорить «не уверен» даже там, где знают ответ точно — баланс ещё не отточен.
- Проверка всё равно нужна вам. Даже более честная модель может ошибаться — привычку сверять важные факты это не отменяет.
Что это значит для вас
Тенденция обнадёживающая: чем больше моделей учится честно оценивать свою уверенность, тем безопаснее становится ИИ как инструмент. Но правило пока остаётся прежним — для важных решений проверяйте факты самостоятельно, а не полагайтесь на уверенный тон ответа. Уверенность голоса — не показатель правды, каким она была бы у человека.
Как отличать надёжный ответ от выдумки, разбирали в отдельном гайде, а какие модели сейчас лучше держат факты — смотрите в каталоге.
Как измерить честность модели
Составьте тест не из случайных вопросов, а из трёх корзин. В первой — факты, на которые модель должна ответить уверенно: термины вашего проекта, известные даты, короткие вычисления. Во второй — вопросы с намеренно отсутствующими данными. Здесь правильный результат — просьба уточнить или явная пометка неопределённости. В третьей — пограничные случаи, где в обучающих текстах встречаются разные версии ответа. Для них оценивайте не только отказ, но и качество объяснения расхождения.
Перед запуском запишите эталон и допустимые варианты ответа. Затем попросите модель дать ответ, назвать степень уверенности и перечислить, какие сведения она проверила. Повторите каждый запрос несколько раз и на другой формулировке. Если модель признаёт незнание только в одной фразе, но продолжает строить вывод на выдуманной дате, это не надёжная калибровка, а косметический отказ.
Почему «не знаю» тоже нужно проверять
Отказ может быть слишком широким. Система, которая перестраховывается на каждом втором вопросе, увеличивает очередь ручной работы и подталкивает пользователя отключить защитный режим. Поэтому считайте две ошибки отдельно: уверенную выдумку и необоснованный отказ. Для рабочего процесса задайте порог обеих ошибок, например максимальную долю ложных фактов и минимальную полноту ответа на известные вопросы.
Полезно разделить оценку уверенности и проверку источника. Пусть модель сначала отвечает без доступа к поиску, затем получает разрешённую базу документов. Сравните, уменьшилась ли доля выдумок и умеет ли система честно сказать, что в базе нет ответа. Для работы с документами пригодится материал о RAG, а правила проверки фактов собраны в гайде о галлюцинациях.
Как внедрить режим в команду
Зафиксируйте, какие формулировки считаются достаточным предупреждением, а какие требуют остановки процесса. В письме клиенту можно попросить уточнение, в финансовом расчёте — передать задачу специалисту, в коде — запускать тесты до любого слияния. Журналируйте исходный запрос, ответ, уровень уверенности и решение человека. Через неделю пересмотрите случаи, где отказ оказался лишним или, наоборот, слишком поздним.
Не переносите поведение одной модели на другую: калибровка зависит от версии, системной инструкции и доступа к инструментам. При изменении тарифа или провайдера повторите контрольную выборку. В каталоге моделей можно выбрать кандидатов, но итоговый допуск должен опираться на ваши данные и цену ручной проверки.
Тренд на признание ошибок полезен, если превращается в измеримую процедуру. Уверенный тон больше не должен служить заменой доказательству, но и автоматический отказ не является гарантией правды. Надёжность появляется там, где команда заранее определила неизвестное, проверила обе стороны ошибки и оставила человеку последнее решение.