ИИ ИИшка Про
← Все нейросети
N

Nemotron 3.5 ASR

NVIDIA
Аудио
★★★★☆ 4.4 / 5

Nemotron 3.5 ASR — открытая модель распознавания речи от NVIDIA, вышедшая в июне 2026 года. Крошечная по нынешним меркам — 600 млн параметров, — но построенная для конкретной задачи: транскрипция в реальном времени для голосовых агентов и стриминга.

Поддерживает около 36 языков в 40 регионолектах — включая русский и украинский. Язык задаётся тегом или определяется автоматически. Пунктуацию и заглавные буквы модель расставляет сама, без постобработки.

Главная особенность — потоковый режим с настраиваемой задержкой: размер обрабатываемого куска выбирается от 80 мс до 1120 мс. Меньше кусок — быстрее реакция, но выше нагрузка; для субтитров в прямом эфире и голосовых ассистентов это ровно тот рычаг, которого не хватает офлайновым моделям. Архитектура — Cache-Aware FastConformer-RNNT, то есть модель не пересчитывает уже обработанный звук.

Веса открыты и лежат на Hugging Face под лицензией OpenMDW-1.1. Размер позволяет запускать модель на обычном ноутбуке — не нужен ни сервер, ни облако. Для дообучения под свой язык, домен или акцент NVIDIA опубликовала отдельное руководство.

Оговорки: это специализированный инструмент — модель только транскрибирует, без перевода и без суммаризации. И как у любого распознавания, качество падает на редких терминах и сильном шуме.

+ Плюсы
  • 36 языков включая русский и украинский
  • Потоковый режим с задержкой от 80 мс
  • Всего 600M параметров — работает на ноутбуке
  • Пунктуация и заглавные из коробки
  • Открытые веса, можно дообучать под свой домен
Минусы
  • Только транскрипция — без перевода и суммаризации
  • Качество падает на редких терминах и шуме
  • Для запуска нужна минимальная техническая подготовка
Тип
Аудио
Контекст
Цена вход
$0/1M
Цена выход
$0/1M
Бесплатно
Да
Работает в РФ
Да
#аудио#распознавание#открытая#локально#стриминг
Перейти на сайт →

Смотрите также