Eleven v3
Eleven v3 — новое поколение синтеза речи ElevenLabs, самая выразительная модель компании. Главный скачок относительно прежних версий — эмоциональный диапазон и контроль подачи.
Языков стало 70+ вместо примерно 32 у линейки Flash — и, что важнее, подтянулась выразительность там, где раньше проседала, например в японском с его тонкими интонациями. Русский поддерживается.
Самая заметная механика — аудио-теги прямо в тексте. Вставляете в реплику [шёпотом], [смеётся], [вздыхает], [пауза] или даже [хлопок двери] — и модель отыгрывает это в озвучке. Это превращает генерацию из «прочитай текст ровным голосом» в режиссуру: вы указываете, где сделать акцент, где понизить голос, где выдержать паузу.
Отдельный режим Text to Dialogue генерирует разговор нескольких персонажей, согласуя интонации между репликами, — годится для сценок, аудиокниг с диалогами и озвучки игр. Модель учитывает не только сам текст, но и то, как произнесены предыдущие реплики.
Оговорки прежние для ElevenLabs: лучшие возможности — в платных тарифах, официального доступа из РФ нет, и вокруг клонирования голоса остаются этические и юридические вопросы. Отдельно: для стабильного результата теги нужно расставлять аккуратно — модель мощная, но требует режиссуры, а не просто вставленного текста.
- ✓70+ языков против ~32 у прежних версий
- ✓Управление интонацией тегами [шёпот], [смех], [пауза]
- ✓Диалоги на несколько голосов с согласованием интонаций
- ✓Резко выше эмоциональный диапазон
- ✓Русский поддерживается
- ✕Лучшие функции — в платных тарифах
- ✕Нет официального доступа из РФ
- ✕Требует аккуратной расстановки тегов — это режиссура, а не «вставь текст»
- ✕Этические вопросы вокруг клонирования голоса остаются