Nemotron 3.5 ASR
Nemotron 3.5 ASR — открытая модель распознавания речи от NVIDIA, вышедшая в июне 2026 года. Крошечная по нынешним меркам — 600 млн параметров, — но построенная для конкретной задачи: транскрипция в реальном времени для голосовых агентов и стриминга.
Поддерживает около 36 языков в 40 регионолектах — включая русский и украинский. Язык задаётся тегом или определяется автоматически. Пунктуацию и заглавные буквы модель расставляет сама, без постобработки.
Главная особенность — потоковый режим с настраиваемой задержкой: размер обрабатываемого куска выбирается от 80 мс до 1120 мс. Меньше кусок — быстрее реакция, но выше нагрузка; для субтитров в прямом эфире и голосовых ассистентов это ровно тот рычаг, которого не хватает офлайновым моделям. Архитектура — Cache-Aware FastConformer-RNNT, то есть модель не пересчитывает уже обработанный звук.
Веса открыты и лежат на Hugging Face под лицензией OpenMDW-1.1. Размер позволяет запускать модель на обычном ноутбуке — не нужен ни сервер, ни облако. Для дообучения под свой язык, домен или акцент NVIDIA опубликовала отдельное руководство.
Оговорки: это специализированный инструмент — модель только транскрибирует, без перевода и без суммаризации. И как у любого распознавания, качество падает на редких терминах и сильном шуме.
- ✓36 языков включая русский и украинский
- ✓Потоковый режим с задержкой от 80 мс
- ✓Всего 600M параметров — работает на ноутбуке
- ✓Пунктуация и заглавные из коробки
- ✓Открытые веса, можно дообучать под свой домен
- ✕Только транскрипция — без перевода и суммаризации
- ✕Качество падает на редких терминах и шуме
- ✕Для запуска нужна минимальная техническая подготовка