ИИ ИИшка Про
← Все нейросети
Alibaba

Qwen-Audio 3.0 TTS

Alibaba
Аудио
★★★★⯨ 4.6 / 5

Qwen-Audio 3.0 TTS — модель синтеза речи от лаборатории Tongyi (Alibaba), представленная 20 июля 2026 года. Заметный игрок в разгоревшейся ценовой войне озвучки: по замерам арены версия Plus заняла первое место (около 1236 Elo), обойдя конкурентов, и при этом стоит примерно втрое дешевле ElevenLabs.

Модель поддерживает 16 языков и 20 регионов китайских диалектов. Два уровня под разные задачи: Flash заточен под реальное время — задержка первого пакета около 300 мс, годится для голосовых ассистентов и живого диалога; Plus — под максимальное качество генерации, где скорость не критична.

Возможности богатые: потоковый ввод и вывод через WebSocket, клонирование голоса, режим Voice Design (создание нового голоса по текстовому описанию) и управление подачей инструкциями. Вывод — PCM, WAV, MP3, Opus с частотой до 48 кГц.

Важная оговорка про открытость. Это закрытая, только-API модель — весов нет, локально не запустить, всё идёт через Alibaba Cloud Model Studio (регионы Сингапур и Пекин). Есть отдельный открытый набор Qwen3-TTS под Apache 2.0 с весами на GitHub — но это другой продукт, поменьше и попроще; сама Qwen-Audio 3.0 TTS остаётся проприетарной. Официального доступа из России, как у сервисов Alibaba, нет.

+ Плюсы
  • Первое место на арене озвучки (Plus, ~1236 Elo)
  • Примерно втрое дешевле ElevenLabs
  • 16 языков и 20 регионов китайских диалектов
  • Клонирование голоса и создание голоса по описанию
  • Flash с задержкой ~300 мс — для реального времени
Минусы
  • Закрытая, только-API — весов нет, локально не запустить
  • Всё через Alibaba Cloud, официального доступа из РФ нет
  • Отдельный открытый Qwen3-TTS — другой продукт, попроще
  • Клонирование голоса несёт этические и юридические риски
Тип
Аудио
Контекст
Цена вход
Цена выход
Бесплатно
Нет
Работает в РФ
Нет
#аудио#озвучка#голос#tts#клонирование
Перейти на сайт →