Alibaba выпустила CosyVoice 2
Alibaba представила новую версию открытой модели синтеза речи — CosyVoice 2. Модель озвучивает текст естественным голосом, поддерживает многие языки, включая русский, и умеет клонировать голос по короткому образцу.
Что изменилось
По сравнению с прошлым поколением подтянулись естественность интонаций, скорость генерации и стабильность. CosyVoice 2 звучит живее и меньше «спотыкается» на длинных фразах. Главная особенность линейки сохранилась — клонирование голоса: после нескольких секунд записи модель может говорить «вашим» голосом.
Ставка на открытость
Ключевой козырь — открытый подход. Веса CosyVoice доступны, модель можно запускать локально на своём железе (нужна видеокарта) и использовать без привязки к западным сервисам. В России она работает без VPN, что выгодно отличает её от ряда закрытых TTS, доступ к которым осложнён.
Кому пригодится
CosyVoice 2 — выбор для озвучки роликов, аудиокниг, голосовых ботов и прототипов, где важны открытость, приватность и доступность. Для тех, кто уже собирает голосовые продукты, открытая модель снимает вопрос привязки к внешнему сервису и оплате за токены.
Этическая сторона
У клонирования голоса есть важная оговорка: клонировать чужой голос без согласия нельзя. Это касается и мошенничества (подделка голоса родственников), и авторских прав. Синтезированную речь стоит честно помечать, особенно если она имитирует реального человека.
Подробности — на странице модели. Чем CosyVoice 2 отличается от закрытого лидера озвучки — в сравнении CosyVoice 2 и ElevenLabs v3. Подобрать модель под задачу поможет подборщик моделей.