CosyVoice 2
CosyVoice 2 — обновление открытой модели синтеза речи (TTS) от Alibaba, представленное в августе 2026 года. Модель озвучивает текст естественным голосом, поддерживает многие языки (включая русский) и умеет клонировать голос по короткому образцу — то есть говорить «вашим» голосом после нескольких секунд записи.
Главный козырь линейки — открытость. Веса CosyVoice доступны, модель можно запускать локально на своём железе и использовать без привязки к западным сервисам. В России она работает без VPN, что выгодно отличает её от ряда закрытых TTS. По сравнению с прошлым поколением подтянулись естественность интонаций, скорость и стабильность.
Хороший выбор для озвучки роликов, аудиокниг, ботов и прототипов, где важны открытость, приватность и доступность. Как и с любой моделью клонирования голоса, есть этическая сторона: клонировать чужой голос без согласия нельзя, а синтезированную речь стоит честно помечать.
- ✓Открытые веса — можно запускать локально
- ✓Клонирование голоса по короткому образцу
- ✓Поддержка многих языков, включая русский
- ✓Работает в РФ без VPN
- ✕Для локального запуска нужна видеокарта
- ✕Клонирование голоса требует согласия — этическая сторона
- ✕Синтезированную речь стоит честно помечать