Qwen3.8 Flash Next и Nemotron-3-Puzzle: сравнение двух новых локальных моделей

Иллюстрация редакции: условное сравнение архитектур, без привязки к интерфейсу производителя.
Две новые модели, появившиеся в свежих сборках локального стека, решают разные задачи. Qwen3.8 Flash Next — разреженная мультимодальная модель с упором на экономию вычислений, а Nemotron-3-Puzzle-75B-A9B — крупная система, ориентированная на рассуждения и работу с инструментами. Обе требуют аккуратной настройки, поэтому сравнивать их только по размеру неправильно.
Архитектура и память
Qwen использует смесь экспертов: на каждом токене активна лишь часть параметров, но дополнительные таблицы могут занимать десятки гигабайт. Это даёт интересное соотношение качества и стоимости, если у вас быстрый диск и достаточно оперативной памяти. Nemotron выглядит проще для понимания по названию и размеру, однако 75B-профиль всё равно предъявляет серьёзные требования к видеопамяти и квантованию.
Мультимодальные входы
Flash Next рассчитан не только на текст: в связке с обновлённым рантаймом он принимает изображения и экспериментальные видеовходы. Это удобно для локального разбора экрана или короткого ролика, но качество зависит от декодера и разрешения. Nemotron разумнее рассматривать как текстовую модель для сложного плана, кода и вызовов инструментов, пока ваш стек не подтверждает обратное.
Скорость и задержка
На коротком вопросе разница может быть незаметной, а на длинном контексте проявится стоимость чтения памяти. Qwen способен быстро выдавать токены после прогрева, но первый ответ часто упирается в загрузку экспертов и n-грамм. Nemotron требует больше вычислений, зато его поведение проще измерять на стабильном наборе запросов. Замеряйте отдельно время до первого токена и скорость после него.
Кому что подходит
Для домашней мультимодальной лаборатории, где важны изображения и экономия VRAM, логичнее начать с Qwen3.8 Flash Next. Для команды, которая строит текстового агента с длинными планами и готова выделить отдельный GPU-сервер, интереснее Nemotron-3-Puzzle. В обоих случаях оставьте облачный резерв для пиковых запросов и сравните его по полной стоимости, как описано в разборе локального контура.
Как поставить честный эксперимент
Соберите тридцать запросов: десять на извлечение фактов, десять на планирование и десять на отказ при нехватке данных. Для Qwen добавьте пять изображений и один короткий ролик. Запишите ошибки, пропуски, повторные вызовы и потребление памяти. Не смешивайте результаты квантованных и полноразмерных сборок. После каждого запуска сохраняйте конфигурацию, чтобы сравнение не превратилось в спор о впечатлениях.
Итог
Qwen3.8 Flash Next выигрывает гибкостью и мультимодальностью, Nemotron-3-Puzzle — запасом для сложного текстового рассуждения. Ни одна модель не отменяет проверку фактов и контроль инструментов. Выбор делайте по своим данным, памяти и допустимой задержке, а не по одному красивому демо.
Перед публикацией
Сохраните исходный пример, версию модели и дату проверки. Уберите персональные данные и секреты, дайте результат прочитать человеку, который не участвовал в постановке задачи. Если ответ нельзя быстро подтвердить по исходным данным, пометьте его черновиком. Такой простой контроль защищает от тихих ошибок лучше, чем уверенный тон модели.
FAQ
Какая модель лучше для изображений?
Qwen3.8 Flash Next рассчитана на мультимодальные входы. Но качество нужно проверить на собственных файлах и разрешении.
Что выбрать для текстового агента?
Nemotron-3-Puzzle может быть разумнее для длинного плана, если есть запас памяти и время на вычисление. Это гипотеза до теста.
Как сравнить квантованные сборки?
Используйте одинаковые запросы, контекст и лимит вывода, отдельно фиксируя память, задержку и ручные исправления.
Полезно заранее определить, какой результат меняет решение. Например, Qwen может быть выбран, если его задержка на изображении не превышает заданный порог, а Nemotron — если он сокращает число ручных уточнений в плане. Запишите эти условия до запуска, чтобы не подгонять вывод под понравившийся ответ. Если обе модели проходят порог, выбирайте более простую в сопровождении и оставляйте вторую как резерв. Такой критерий делает сравнение рабочим инструментом, а не красивой таблицей характеристик.
Как не ошибиться с итогом
Сделайте два прохода. В первом оператор не знает, какая модель сформировала ответ, и оценивает только точность и полноту. Во втором добавьте эксплуатационные данные: время загрузки, расход памяти, число повторов и стоимость электричества или облачного резерва. Если модель выигрывает по качеству, но требует постоянного ручного перезапуска, это тоже часть результата. Не смешивайте показатели разных квантований и не сравнивайте один удачный запрос с серией неудачных. Через месяц повторите тест на новых документах: так станет видно, сохраняется ли преимущество за пределами подготовленного набора.