Новости —
OpenAI выпустила gpt-realtime-2.1 — голосовые ИИ-агенты отвечают на 25% быстрее
AI-редакция · перевод с источника MarkTechPost, OpenAI Developer Community
OpenAI выпустила в API новые модели для голосовых ИИ-агентов реального времени — gpt-realtime-2.1 и облегчённую gpt-realtime-2.1-mini. Обновление нацелено на голосовых ассистентов и мультимодальные сценарии с минимальной задержкой ответа.
Что нового
- Задержка снижена минимум на 25% по всем голосовым моделям реального времени благодаря улучшенному кэшированию
- Лучше распознаёт буквы и цифры — актуально для голосовых агентов поддержки, где часто нужно продиктовать код или номер
- Улучшена обработка тишины, шума и прерываний — модель точнее понимает, когда пользователь действительно закончил говорить
- Настраиваемый уровень рассуждений — от minimal до xhigh, по умолчанию низкий, чтобы не терять скорость на простых репликах
Две версии под разные задачи
- gpt-realtime-2.1 — максимальное качество рассуждений, работы с инструментами и поведения голосового агента
- gpt-realtime-2.1-mini — быстрее и дешевле, при этом цена осталась на уровне прошлой mini-версии: $0,6 за млн входных токенов и $2,4 за млн выходных
Почему это важно
Голосовые ИИ-агенты — один из самых требовательных к задержке сценариев использования нейросетей: если ответ занимает больше секунды-двух, разговор перестаёт ощущаться живым. Снижение задержки на четверть — заметный шаг для колл-центров, голосовых помощников и любых сервисов, где важна естественность диалога. Подробнее о том, как вообще работают голосовые нейросети — в нашем обзоре голосовых нейросетей.
Оригинал: MarkTechPost, OpenAI Developer Community