DeepSeek V4: открытая MoE-модель с контекстом до миллиона токенов
DeepSeek представила новое поколение моделей V4 в вариантах V4-Pro и V4-Flash. В анонсе выделены архитектура Mixture of Experts, окно контекста до миллиона токенов, гибридное внимание и ориентация на агентные задачи. Для пользователя это означает больше вариантов развёртывания, но не готовую гарантию качества: заявленные параметры нужно проверять на собственных документах, коде и оборудовании.
Что означает MoE в этой модели
В плотной сети каждый токен проходит через один и тот же набор параметров. В MoE маршрутизатор выбирает несколько «экспертов» из большого набора, поэтому на конкретном шаге вычисляется только активная часть. Это может уменьшить стоимость ответа, однако все веса всё равно нужно хранить, загружать и обновлять. Требования к памяти и времени старта не исчезают вместе с красивой цифрой активных параметров.
Подробно принцип разобран в материале о MoE. Для практического запуска важнее не общее число параметров, а размер выбранного файла, формат квантования, объём видеопамяти и поведение при одновременных запросах.
Миллион токенов — не пропуск к идеальной памяти
Большое окно позволяет передать кодовую базу или архив документов одним маршрутом. Но модель может пропустить факт в середине текста, особенно если там повторяющиеся заголовки и старые версии. Проверьте это отдельно: поместите контрольные маркеры в начало, середину и конец файла, добавьте таблицу и приложение с исключением, затем попросите вернуть каждый маркер с цитатой.
Запишите время до первого токена, скорость после прогрева, пик памяти и долю найденных фактов. Повторите тест после изменения размера контекста. Если качество падает при добавлении документов, делите архив на этапы поиска, а не увеличивайте окно вслепую.
V4-Pro и V4-Flash
Два варианта позволяют разделить задачи по цене и задержке. Более лёгкий Flash логично проверять на классификации, коротком извлечении и черновой маршрутизации. Pro можно оставить для сложного анализа, кода и длинного сравнения. Это рабочая гипотеза, а не рейтинг: на русском тексте, числах или редком домене порядок может измениться.
Составьте закрытый набор из двадцати примеров: вопросы по документам, код с тестами, таблица с числами, запрос без ответа и конфликтующие версии. Запустите оба варианта с одинаковым промптом и измерьте не длину ответа, а число исправлений и корректных отказов. Сохраните версии весов и движка, чтобы повторить сравнение после обновления.
Агентные сценарии
V4 заявлена как подходящая для последовательных задач, где модель читает контекст, строит план и обращается к инструментам. Безопасный маршрут начинается с режима чтения. Агент получает только разрешённые файлы, возвращает план и останавливается перед записью, отправкой письма или изменением данных.
Задайте максимум шагов, тайм-аут и белый список аргументов. Если инструмент вернул пустой результат или контекст изменился, агент должен запросить повторное чтение. Не разрешайте модели самостоятельно менять лимиты, устанавливать пакеты и удалять файлы. Вся команда и её результат попадают в журнал без секретов.
Локальное развёртывание
Открытые веса дают контроль над версией и передачей документов, но ответственность переходит к владельцу сервера. Перед запуском проверьте лицензию, требования к памяти, совместимость с движком и способ отката. Квантование уменьшает размер, но может ухудшить редкие слова, числа и код — эти случаи должны входить в контрольный набор.
Начните с изолированной машины без доступа к клиентским папкам. Отключите телеметрию, ограничьте сеть и очистите временные файлы после теста. Для нескольких пользователей измерьте очередь и пиковую задержку: MoE может быть быстрой в одиночном запросе и нестабильной под параллельной нагрузкой.
Если локальные ресурсы не подходят, можно сравнить вариант с API. Внешний сервис проще масштабировать, но требует проверки региона обработки, сроков хранения и условий обучения на запросах. Сравнение локального и облачного ИИ поможет разложить расходы по полному циклу.
Как считать экономию
Не переносите рекламное «дешевле» прямо в бюджет. Сложите стоимость GPU или аренды, электричества, поддержки, обновлений и ручной проверки. Для API добавьте входные и выходные токены, контекст, повторы и вызовы инструментов. Сравнивайте цену принятого результата за неделю, а не одного удачного ответа.
Отдельно измерьте холодный старт. Если модель запускается несколько минут, это может быть критично для интерактивного сервиса и незаметно для ночной пакетной обработки. Зафиксируйте допустимую задержку до пилота и не меняйте её после получения удобного результата.
Открытая модель и безопасность данных
Открытые веса не делают входные документы автоматически безопасными. Защитите диски, резервные копии, логи и доступ к серверу. Маскируйте имена, адреса, ключи и номера договоров до отправки в контекст. Для корпоративной базы добавьте дату действия и владельца каждому фрагменту, чтобы V4 не смешивала архив с действующей инструкцией.
При обновлении модели повторяйте негативные тесты: prompt-инъекция в документе, конфликт ролей, отсутствующая дата и просьба выполнить запрещённую команду. Корректный отказ важнее более длинного ответа.
Для кого V4 имеет смысл
Модель интересна командам, которым нужен контроль над хранением и возможность запускать открытые веса внутри своей инфраструктуры. Для нерегулярных коротких запросов установка большого стека может оказаться сложнее и дороже облачного вызова. Выбор делайте по нагрузке, требованиям к данным и наличию специалиста, который будет обновлять систему.
Итог
DeepSeek V4 сочетает MoE и большое контекстное окно, а Pro и Flash позволяют разделять сложные и быстрые задачи. Эти характеристики полезны только после проверки: длинный контекст нужно тестировать маркерами, локальный запуск — лицензией и памятью, агентный режим — ограниченными правами. Начните с изолированного набора, сравните стоимость полного результата и оставьте критичные действия под контролем человека.