DeepSeek V4 вышел из preview: что даёт стабильный релиз открытой MoE-модели
24 июля DeepSeek перевела V4 из preview в стабильный статус (GA). Модель была доступна раньше, но переход меняет ожидания от интерфейса и совместимости: команде проще зафиксировать версию, описать интеграцию и планировать обновления. Сам по себе ярлык GA не означает, что каждый ответ стал точнее или что крупная конфигурация запускается на обычном ноутбуке.
Что входит в V4
Линейка представлена вариантами V4-Pro и V4-Flash, построенными на Mixture of Experts. Маршрутизатор активирует часть экспертов для конкретного токена, поэтому вычисления могут быть экономичнее плотной модели сопоставимого размера. Но все веса всё равно нужно хранить и загружать, а обмен между экспертами добавляет требования к памяти и сети.
В описании релиза указано окно контекста до миллиона токенов и большой максимальный вывод. Для практического решения важнее не верхняя граница, а поведение на ваших документах. Модель может пропустить исключение в приложении к договору или перепутать версии, даже если технически принимает весь архив.
Что означает GA для интеграции
Preview допускает изменения API, формата ответа и поведения без длительного переходного периода. Стабильная версия обычно означает зафиксированный идентификатор и понятные правила обновления, но не пожизненную неизменность. Перед переводом в рабочий процесс запишите версию движка, схему вызова, лимиты, код ошибок и дату следующего пересмотра.
Сделайте повторяемый тест до подключения к продукту. Отправьте один и тот же набор запросов дважды, сохраните JSON-ответы и сравните поля. Проверяйте не только успешный сценарий, но и тайм-аут, слишком длинный контекст, пустой результат и отказ инструмента. Если новая версия меняет структуру, приложение должно показать понятную ошибку, а не молча записать неполные данные.
Как читать 80,6% на SWE-bench
В публикациях вокруг V4 упоминается результат 80,6% на SWE-bench Verified. Это показатель на фиксированном наборе задач из открытых репозиториев, а не прогноз для любого проекта. На итог влияют подготовка окружения, доступные тесты, правила оценки и число попыток. Сравнивать процент с другим бенчмарком напрямую нельзя.
Для своей команды составьте небольшой закрытый набор: исправление бага, изменение API, рефакторинг и негативный тест. Пусть модель работает в отдельной ветке, а человек оценивает diff и запускает CI. Запишите число пропущенных условий, повторных запросов и ручных правок. Только эти данные покажут, совпадает ли публичный результат с вашим стеком.
Цена и локальный запуск
Открытые веса дают возможность контролировать размещение документов и версию модели. Одновременно на владельца ложатся расходы на GPU, электричество, хранение, обновление драйверов и мониторинг. V4-Pro с большим числом параметров потребует серверного класса оборудования; Flash может быть практичнее для лёгких задач, но это нужно проверить измерением памяти и скорости.
Перед загрузкой модели проверьте лицензию и формат весов. Квантование уменьшает размер, однако способно ухудшить редкие русские слова, числа и код. Возьмите три типа входа — русский документ, таблицу и фрагмент программы — и сравните точность до и после квантования. Если ответы стали короче, это ещё не доказательство экономии: проверьте полноту и число исправлений.
Тест длинного контекста
Соберите архив из нескольких документов, добавьте контрольные маркеры в начало, середину и конец, а один факт спрячьте в таблицу. Попросите V4 вернуть маркеры с указанием заголовка и даты источника. Повторите запуск после добавления старой версии файла. Хороший результат — не просто правильная фраза, а ссылка на действующий фрагмент и сообщение о конфликте.
Измеряйте время до первого токена, скорость после прогрева, пиковую память и долю найденных маркеров. На миллионе токенов задержка и стоимость передачи могут стать главным ограничением. Для интерактивного сервиса лучше разделить поиск и генерацию, чем каждый раз пересылать весь архив.
Агентный режим
V4 можно использовать как часть последовательного маршрута: прочитать issue, найти файлы, предложить патч и остановиться перед коммитом. Агент получает только тестовый репозиторий и белый список инструментов. Ограничьте число шагов, тайм-аут и права записи. Не разрешайте модели менять лимиты, устанавливать пакеты или отправлять данные наружу.
Перед любым необратимым действием показывайте человеку план, аргументы и diff. Если контекст изменился, агент должен перечитать состояние, а не повторить старую команду. Журнал сохраняет версию модели и результат тестов, но не секреты и персональные данные.
Россия и доступность
Перед внедрением проверьте актуальный способ доступа к API и региональные условия. Сторонний посредник может менять лимиты, задержку и правила хранения. Для локального пилота используйте обезличенные материалы и изолированную сеть. Если требования к поддержке выше, чем готова обеспечить команда, облачный вариант может оказаться честнее и дешевле по полному циклу.
Кому подходит стабильная V4
GA-статус полезен командам, которым нужна предсказуемая версия открытой модели и возможность контролировать инфраструктуру. Для нерегулярных коротких запросов установка большого MoE-стека вряд ли оправдана. Выбор делайте по объёму, классу данных, допустимой задержке и наличию владельца обновлений.
Итог
Переход DeepSeek V4 из preview в стабильный релиз упрощает планирование интеграции, но не отменяет инженерную проверку. Бенчмарк показывает потенциал, а не готовый результат; миллион токенов не гарантирует полную память; открытые веса не избавляют от расходов и ответственности. Зафиксируйте версию, проведите тест на своём коде и документах, ограничьте агентные права и сравните стоимость принятого результата — только после этого решайте, подходит ли V4 для продакшена.