Разметка озвучки аудио-тегами
Современные модели озвучки (Eleven v3 и подобные) отыгрывают теги прямо в тексте: [шёпот], [смех], [пауза]. Разметьте реплику — проверим теги и посчитаем символы, которые реально пойдут в озвучку.
Кликните, чтобы вставить в текст. Точный набор зависит от модели — сверяйтесь с её документацией; это ходовые.
Как это работает
Теги — это режиссура, а не текст. Модель озвучки читает [шёпот] это секрет как «это секрет», сказанное шёпотом. Сам тег вслух не произносится — поэтому в озвучку идут только символы вне квадратных скобок. Именно их считают сервисы TTS, когда берут плату за символы, — этот счётчик показывает реальную цифру.
Незнакомый тег — риск. Если модель не знает тег, поведение непредсказуемо: в лучшем случае она его проигнорирует, в худшем — попробует произнести. Инструмент подсвечивает такие теги, чтобы вы заменили их на знакомые.
Не переусердствуйте. Тег в каждом предложении делает речь дёрганой. Ставьте акценты там, где они меняют смысл, — остальное модель озвучит естественно сама.
Всё считается в браузере, текст никуда не отправляется. Прикинуть длительность готовой озвучки поможет калькулятор времени чтения, а разбить длинную реплику под лимит — разбивщик текста.