Qwen-Audio 3.0 TTS
Qwen-Audio 3.0 TTS — модель синтеза речи от лаборатории Tongyi (Alibaba), представленная 20 июля 2026 года. Заметный игрок в разгоревшейся ценовой войне озвучки: по замерам арены версия Plus заняла первое место (около 1236 Elo), обойдя конкурентов, и при этом стоит примерно втрое дешевле ElevenLabs.
Модель поддерживает 16 языков и 20 регионов китайских диалектов. Два уровня под разные задачи: Flash заточен под реальное время — задержка первого пакета около 300 мс, годится для голосовых ассистентов и живого диалога; Plus — под максимальное качество генерации, где скорость не критична.
Возможности богатые: потоковый ввод и вывод через WebSocket, клонирование голоса, режим Voice Design (создание нового голоса по текстовому описанию) и управление подачей инструкциями. Вывод — PCM, WAV, MP3, Opus с частотой до 48 кГц.
Важная оговорка про открытость. Это закрытая, только-API модель — весов нет, локально не запустить, всё идёт через Alibaba Cloud Model Studio (регионы Сингапур и Пекин). Есть отдельный открытый набор Qwen3-TTS под Apache 2.0 с весами на GitHub — но это другой продукт, поменьше и попроще; сама Qwen-Audio 3.0 TTS остаётся проприетарной. Официального доступа из России, как у сервисов Alibaba, нет.
- ✓Первое место на арене озвучки (Plus, ~1236 Elo)
- ✓Примерно втрое дешевле ElevenLabs
- ✓16 языков и 20 регионов китайских диалектов
- ✓Клонирование голоса и создание голоса по описанию
- ✓Flash с задержкой ~300 мс — для реального времени
- ✕Закрытая, только-API — весов нет, локально не запустить
- ✕Всё через Alibaba Cloud, официального доступа из РФ нет
- ✕Отдельный открытый Qwen3-TTS — другой продукт, попроще
- ✕Клонирование голоса несёт этические и юридические риски