ИИ ИИшка Про
Обзоры

Нейросети для поддержки клиентов в 2026: что реально закрывает первую линию, а что ломается на втором вопросе

AI-редакция

Поддержка клиентов — самая массовая корпоративная задача для ИИ и самая обманчивая. Демо всегда выглядит блестяще: модель вежливо отвечает на типовой вопрос. Проблемы начинаются на втором вопросе, где клиент уточняет условия, и на третьем, где он недоволен. Разберём, что реально работает.

Что вообще делает ИИ в поддержке

Полезно сразу разделить четыре разные задачи — их часто путают, а требования у них противоположные.

ЗадачаЧто нужно от моделиЦена ошибки
Ответ на типовой вопросТочность по документамНизкая
Диалог с уточнениямиПамять контекста, честностьСредняя
Действие в системеСтрогие ограниченияВысокая
Подсказка операторуСкорость, краткостьПочти нулевая

Самый недооценённый сценарий — последний. Агент, который не отвечает клиенту, а подсказывает живому оператору, даёт большую часть выгоды почти без рисков. С него разумно начинать.

Текстовый чат: чем закрывать первую линию

Claude Sonnet 5 — рабочая лошадка для поддержки. Хорошо держится в рамках инструкций, редко выдумывает условия, аккуратно признаёт незнание — а для поддержки это важнее блеска формулировок. Большое окно контекста позволяет держать регламенты прямо в диалоге.

GPT-5.6 Luna — сильна там, где нужен живой разговорный тон и работа с недовольством клиента. Хорошо переформулирует, снижает накал. Обратная сторона той же черты: под нажимом склонна соглашаться, поэтому запреты надо прописывать жёстко.

Gemini 3.6 Flash и другие лёгкие модели — для высокого потока однотипных обращений. Разница в цене между флагманом и лёгкой моделью на объёмах поддержки решает: если 80% обращений — это пять типовых вопросов, гонять их через флагман бессмысленно.

DeepSeek V4 — вариант для тех, кому важна открытость и работа в России. Цена на порядок ниже западных флагманов, качество для типовых сценариев достаточное.

Практический подход — маршрутизация: лёгкая модель разбирает поток и отвечает на простое, флагман подключается на сложном. Это экономит больше, чем любые оптимизации промта.

Голос: отдельная история

Голосовая поддержка — не «то же самое, но вслух». Три отличия ломают наивный перенос:

  • Задержка видна. В чате пауза в две секунды незаметна, в разговоре — неловкая тишина. Прикинуть бюджет времени поможет калькулятор задержки.
  • Нельзя переписать ответ. Сказанное сказано; в чате пользователь простит правку следующим сообщением, в голосе — нет.
  • Распознавание ошибается на именах и номерах. Фамилия, адрес, номер заказа — главный источник сбоев. Всегда проговаривайте распознанное обратно для подтверждения.

Для распознавания речи рабочие варианты — Whisper и специализированные модели вроде Nemotron 3.5 ASR; для синтеза — ElevenLabs v3, где теги интонации задаются прямо в тексте (разметить реплики удобно помощником по аудио-тегам).

Что отделяет демо от рабочей линии

Модель — меньшая часть задачи. Вот что решает на практике.

Источник правды. Ответы про тарифы, сроки и условия должны приходить из документов, а не из памяти модели. Иначе агент однажды пообещает скидку, которой нет.

Гардрейлы. Жёсткие запреты, которые не обходятся уговорами клиента. Как их формулировать — в гайде про правила поведения агента.

Эскалация с контекстом. Передача человеку должна нести краткую суть диалога. Иначе клиент рассказывает свою историю второй раз, и экономия съедается его раздражением.

Регресс после правок. Правка промта, чинящая один случай, регулярно ломает два соседних. Без прогона одного и того же набора сценариев это не видно.

Крупные вендоры это поняли: OpenAI в июле выпустила Presence — платформу, где всё перечисленное идёт из коробки, и продаёт уже не доступ к модели, а обвязку вокруг неё.

Где ИИ в поддержке ошибается

Придумывает условия. Самая дорогая ошибка. Лечится только источником правды, а не выбором модели.

Соглашается под нажимом. Настойчивый клиент выбивает согласие, потому что модель обучена быть полезной. Лечится жёсткими гардрейлами.

Не понимает, что застряла. Может ходить по кругу бесконечно. Лечится правилом: два круга без прогресса — эскалация.

Теряется на смеси языков. «Здравствуйте, my order number is…» — типичная ситуация, на которой падает качество. Проверяйте отдельно, если аудитория смешанная.

С чего начать, если вы только внедряете

  1. Соберите топ-20 обращений за последний месяц. Это ваш реальный поток, а не воображаемый.
  2. Начните с подсказок оператору, а не с автоответов. Риск нулевой, выгода видна сразу.
  3. Опишите политики — тарифы, сроки, условия — как отдельный документ с датой.
  4. Пропишите эскалацию раньше, чем начнёте отвечать клиентам автоматически.
  5. Считайте не токены, а разборы. Основной расход — время людей на анализ случаев, где агент ошибся. Прикинуть денежную сторону поможет калькулятор окупаемости ИИ.

Что запомнить

  • Разделяйте четыре задачи: ответ, диалог, действие, подсказка оператору. Начинайте с последней.
  • Держите маршрутизацию: лёгкая модель на поток, флагман на сложное.
  • Голос — не чат вслух: задержка, необратимость реплики, ошибки на именах и номерах.
  • Решает не модель, а источник правды, гардрейлы, эскалация и регресс.
  • Считайте расход в разборах, а не в токенах.

Подобрать модель под свой сценарий помогут подборщик моделей и сравнение моделей.