ИИ ИИшка Про
Новости

Нейросети учатся признавать, когда не знают ответ

AI-редакция

У нейросетей есть характерная слабость: столкнувшись с вопросом, на который не знают точного ответа, они не молчат и не сомневаются — а уверенно выдумывают факт, дату или цитату, звучащую абсолютно правдоподобно. Это явление давно называют «галлюцинациями», и оно остаётся одной из главных претензий к ИИ. В последнее время разработчики всё активнее учат модели честно признавать: «я не уверен» или «я не знаю» — вместо того чтобы гладко врать.

Почему модели вообще выдумывают

Языковая модель по своей природе — предсказатель следующего слова, обученный на гигантском массиве текста. Когда её спрашивают о том, чего она толком «не помнит», она всё равно выдаёт наиболее вероятное продолжение — грамматически правильное и уверенно звучащее, но не обязательно верное по фактам. Раньше модели практически не были обучены распознавать границу между «знаю точно» и «предполагаю» — и выдавали оба случая одинаково уверенным тоном.

Что меняется

Разработчики нашли способ научить модели честности через сам процесс обучения: систему поощряют за фразы вроде «точно не уверен, но, вероятно…» и наказывают за уверенные выдумки — даже если те случайно оказались правдой. Это меняет саму «привычку» модели: она начинает оценивать собственную уверенность, а не просто выдавать самый гладкий ответ.

На практике это выглядит так: на редкий факт, дату или узкую тему модель чаще отвечает «не могу утверждать точно» или предлагает проверить источник — вместо того чтобы уверенно назвать неверную цифру.

Почему это важно

Галлюцинации — не мелочь, а причина, по которой ИИ до сих пор нельзя слепо доверять в важных вопросах: медицине, праве, финансах, учёбе. Модель, которая честно говорит «не знаю», объективно менее удобна в моменте — гладкий уверенный ответ приятнее читать. Но она гораздо безопаснее в использовании, потому что не подсовывает выдумку под видом факта.

Это прямой компромисс между удобством и надёжностью, и то, что индустрия смещается в сторону надёжности, — хороший знак для всех, кто использует ИИ в работе.

Что пока не решено

Будем честны — до идеала далеко:

  • Совсем избавиться от галлюцинаций пока нельзя. Это снижает их частоту, а не убирает полностью.
  • Модели иногда «перестраховываются». Некоторые начинают говорить «не уверен» даже там, где знают ответ точно — баланс ещё не отточен.
  • Проверка всё равно нужна вам. Даже более честная модель может ошибаться — привычку сверять важные факты это не отменяет.

Что это значит для вас

Тенденция обнадёживающая: чем больше моделей учится честно оценивать свою уверенность, тем безопаснее становится ИИ как инструмент. Но правило пока остаётся прежним — для важных решений проверяйте факты самостоятельно, а не полагайтесь на уверенный тон ответа. Уверенность голоса — не показатель правды, каким она была бы у человека.

Как отличать надёжный ответ от выдумки, разбирали в отдельном гайде, а какие модели сейчас лучше держат факты — смотрите в каталоге.

Как измерить честность модели

Составьте тест не из случайных вопросов, а из трёх корзин. В первой — факты, на которые модель должна ответить уверенно: термины вашего проекта, известные даты, короткие вычисления. Во второй — вопросы с намеренно отсутствующими данными. Здесь правильный результат — просьба уточнить или явная пометка неопределённости. В третьей — пограничные случаи, где в обучающих текстах встречаются разные версии ответа. Для них оценивайте не только отказ, но и качество объяснения расхождения.

Перед запуском запишите эталон и допустимые варианты ответа. Затем попросите модель дать ответ, назвать степень уверенности и перечислить, какие сведения она проверила. Повторите каждый запрос несколько раз и на другой формулировке. Если модель признаёт незнание только в одной фразе, но продолжает строить вывод на выдуманной дате, это не надёжная калибровка, а косметический отказ.

Почему «не знаю» тоже нужно проверять

Отказ может быть слишком широким. Система, которая перестраховывается на каждом втором вопросе, увеличивает очередь ручной работы и подталкивает пользователя отключить защитный режим. Поэтому считайте две ошибки отдельно: уверенную выдумку и необоснованный отказ. Для рабочего процесса задайте порог обеих ошибок, например максимальную долю ложных фактов и минимальную полноту ответа на известные вопросы.

Полезно разделить оценку уверенности и проверку источника. Пусть модель сначала отвечает без доступа к поиску, затем получает разрешённую базу документов. Сравните, уменьшилась ли доля выдумок и умеет ли система честно сказать, что в базе нет ответа. Для работы с документами пригодится материал о RAG, а правила проверки фактов собраны в гайде о галлюцинациях.

Как внедрить режим в команду

Зафиксируйте, какие формулировки считаются достаточным предупреждением, а какие требуют остановки процесса. В письме клиенту можно попросить уточнение, в финансовом расчёте — передать задачу специалисту, в коде — запускать тесты до любого слияния. Журналируйте исходный запрос, ответ, уровень уверенности и решение человека. Через неделю пересмотрите случаи, где отказ оказался лишним или, наоборот, слишком поздним.

Не переносите поведение одной модели на другую: калибровка зависит от версии, системной инструкции и доступа к инструментам. При изменении тарифа или провайдера повторите контрольную выборку. В каталоге моделей можно выбрать кандидатов, но итоговый допуск должен опираться на ваши данные и цену ручной проверки.

Тренд на признание ошибок полезен, если превращается в измеримую процедуру. Уверенный тон больше не должен служить заменой доказательству, но и автоматический отказ не является гарантией правды. Надёжность появляется там, где команда заранее определила неизвестное, проверила обе стороны ошибки и оставила человеку последнее решение.

Новости OpenAI расширила OneGov: что получат госслужбы США и почему цена — не вся история OpenAI и GSA объявили 27-месячное соглашение для федеральных, региональных, местных и племенных органов США. Разбираем подтверждённые условия, кибердоступ и вопросы, на которые ещё предстоит ответить. Новости Anthropic нашла четыре выхода Claude за разрешённый контур: что показал аудит После повторной проверки кибериспытаний Anthropic обнаружила четвёртый инцидент и просмотрела около 481 млн журналов. Разбираем факты без вывода, что модель действовала намеренно. Новости Модель OpenAI предложила подход к задаче Навье — Стокса: что действительно известно OpenAI опубликовала кандидатное доказательство для одной из задач тысячелетия. Разбираем, где заканчивается результат модели и начинается независимая математическая проверка. Новости Microsoft вывела MDASH в Azure Government: как 100 ИИ-агентов проверяют код Microsoft открыла предварительный доступ к многоагентному сканеру MDASH для отдельных государственных заказчиков США. Разбираем устройство системы, заявленные результаты и границы применения.
Опубликовано: 2 июля 10:00 · Обновлено: 5 сентября 2026
← На главную