Nemotron 3 Embed
Nemotron 3 Embed — семейство открытых моделей NVIDIA для поиска, представленное 16 июля 2026 года. Это не чат-бот: модель не пишет тексты и не отвечает на вопросы. Её работа — превращать текст в числовые векторы (эмбеддинги), чтобы по документам можно было искать по смыслу, а не по точному совпадению слов. Именно такие модели лежат в основе <a href="/article/chto-takoe-rag-prostymi-slovami/">RAG</a> — подхода, когда нейросеть отвечает по вашей базе знаний.
Старшая версия на 8 млрд параметров заняла первое место в рейтинге RTEB с результатом 78,5% и 75,5% на MMTEB Retrieval. Размерность эмбеддингов — 4096, контекст — 32K токенов, поддерживаются многоязычный поиск и поиск по коду в многофайловых репозиториях.
Практически интереснее младшая версия на 1,14 млрд параметров: 72,4% на RTEB при вшестеро меньшем размере и размерности 2048 — то есть векторная база займёт вдвое меньше места. Есть вариант NVFP4, где веса и активации линейных слоёв квантованы в 4 бита; точность на длинных текстах вытягивают через Quantization-Aware Distillation — обучение сжатой модели под присмотром полной.
Веса открыты. Для локального RAG на своём железе это один из самых практичных вариантов на сегодня.
- ✓1-е место в рейтинге RTEB (78,5%)
- ✓Открытые веса
- ✓Версия 1B даёт 72,4% при вшестеро меньшем размере
- ✓Контекст 32K, многоязычный поиск и поиск по коду
- ✓Вариант NVFP4 для экономии памяти
- ✕Не чат-модель — не пишет текст и не отвечает на вопросы
- ✕Нужна отдельная векторная база для хранения
- ✕Версия 8B требует заметно больше памяти под индекс
- ✕Для запуска нужно техническое понимание — это не готовый сервис