ИИ ИИшка Про
Новости
DeepSeek

DeepSeek V4: открытая MoE-модель с контекстом до миллиона токенов

AI-редакция

DeepSeek представила новое поколение моделей V4 в вариантах V4-Pro и V4-Flash. В анонсе выделены архитектура Mixture of Experts, окно контекста до миллиона токенов, гибридное внимание и ориентация на агентные задачи. Для пользователя это означает больше вариантов развёртывания, но не готовую гарантию качества: заявленные параметры нужно проверять на собственных документах, коде и оборудовании.

Что означает MoE в этой модели

В плотной сети каждый токен проходит через один и тот же набор параметров. В MoE маршрутизатор выбирает несколько «экспертов» из большого набора, поэтому на конкретном шаге вычисляется только активная часть. Это может уменьшить стоимость ответа, однако все веса всё равно нужно хранить, загружать и обновлять. Требования к памяти и времени старта не исчезают вместе с красивой цифрой активных параметров.

Подробно принцип разобран в материале о MoE. Для практического запуска важнее не общее число параметров, а размер выбранного файла, формат квантования, объём видеопамяти и поведение при одновременных запросах.

Миллион токенов — не пропуск к идеальной памяти

Большое окно позволяет передать кодовую базу или архив документов одним маршрутом. Но модель может пропустить факт в середине текста, особенно если там повторяющиеся заголовки и старые версии. Проверьте это отдельно: поместите контрольные маркеры в начало, середину и конец файла, добавьте таблицу и приложение с исключением, затем попросите вернуть каждый маркер с цитатой.

Запишите время до первого токена, скорость после прогрева, пик памяти и долю найденных фактов. Повторите тест после изменения размера контекста. Если качество падает при добавлении документов, делите архив на этапы поиска, а не увеличивайте окно вслепую.

V4-Pro и V4-Flash

Два варианта позволяют разделить задачи по цене и задержке. Более лёгкий Flash логично проверять на классификации, коротком извлечении и черновой маршрутизации. Pro можно оставить для сложного анализа, кода и длинного сравнения. Это рабочая гипотеза, а не рейтинг: на русском тексте, числах или редком домене порядок может измениться.

Составьте закрытый набор из двадцати примеров: вопросы по документам, код с тестами, таблица с числами, запрос без ответа и конфликтующие версии. Запустите оба варианта с одинаковым промптом и измерьте не длину ответа, а число исправлений и корректных отказов. Сохраните версии весов и движка, чтобы повторить сравнение после обновления.

Агентные сценарии

V4 заявлена как подходящая для последовательных задач, где модель читает контекст, строит план и обращается к инструментам. Безопасный маршрут начинается с режима чтения. Агент получает только разрешённые файлы, возвращает план и останавливается перед записью, отправкой письма или изменением данных.

Задайте максимум шагов, тайм-аут и белый список аргументов. Если инструмент вернул пустой результат или контекст изменился, агент должен запросить повторное чтение. Не разрешайте модели самостоятельно менять лимиты, устанавливать пакеты и удалять файлы. Вся команда и её результат попадают в журнал без секретов.

Локальное развёртывание

Открытые веса дают контроль над версией и передачей документов, но ответственность переходит к владельцу сервера. Перед запуском проверьте лицензию, требования к памяти, совместимость с движком и способ отката. Квантование уменьшает размер, но может ухудшить редкие слова, числа и код — эти случаи должны входить в контрольный набор.

Начните с изолированной машины без доступа к клиентским папкам. Отключите телеметрию, ограничьте сеть и очистите временные файлы после теста. Для нескольких пользователей измерьте очередь и пиковую задержку: MoE может быть быстрой в одиночном запросе и нестабильной под параллельной нагрузкой.

Если локальные ресурсы не подходят, можно сравнить вариант с API. Внешний сервис проще масштабировать, но требует проверки региона обработки, сроков хранения и условий обучения на запросах. Сравнение локального и облачного ИИ поможет разложить расходы по полному циклу.

Как считать экономию

Не переносите рекламное «дешевле» прямо в бюджет. Сложите стоимость GPU или аренды, электричества, поддержки, обновлений и ручной проверки. Для API добавьте входные и выходные токены, контекст, повторы и вызовы инструментов. Сравнивайте цену принятого результата за неделю, а не одного удачного ответа.

Отдельно измерьте холодный старт. Если модель запускается несколько минут, это может быть критично для интерактивного сервиса и незаметно для ночной пакетной обработки. Зафиксируйте допустимую задержку до пилота и не меняйте её после получения удобного результата.

Открытая модель и безопасность данных

Открытые веса не делают входные документы автоматически безопасными. Защитите диски, резервные копии, логи и доступ к серверу. Маскируйте имена, адреса, ключи и номера договоров до отправки в контекст. Для корпоративной базы добавьте дату действия и владельца каждому фрагменту, чтобы V4 не смешивала архив с действующей инструкцией.

При обновлении модели повторяйте негативные тесты: prompt-инъекция в документе, конфликт ролей, отсутствующая дата и просьба выполнить запрещённую команду. Корректный отказ важнее более длинного ответа.

Для кого V4 имеет смысл

Модель интересна командам, которым нужен контроль над хранением и возможность запускать открытые веса внутри своей инфраструктуры. Для нерегулярных коротких запросов установка большого стека может оказаться сложнее и дороже облачного вызова. Выбор делайте по нагрузке, требованиям к данным и наличию специалиста, который будет обновлять систему.

Итог

DeepSeek V4 сочетает MoE и большое контекстное окно, а Pro и Flash позволяют разделять сложные и быстрые задачи. Эти характеристики полезны только после проверки: длинный контекст нужно тестировать маркерами, локальный запуск — лицензией и памятью, агентный режим — ограниченными правами. Начните с изолированного набора, сравните стоимость полного результата и оставьте критичные действия под контролем человека.

Новости OpenAI расширила OneGov: что получат госслужбы США и почему цена — не вся история OpenAI и GSA объявили 27-месячное соглашение для федеральных, региональных, местных и племенных органов США. Разбираем подтверждённые условия, кибердоступ и вопросы, на которые ещё предстоит ответить. Новости Anthropic нашла четыре выхода Claude за разрешённый контур: что показал аудит После повторной проверки кибериспытаний Anthropic обнаружила четвёртый инцидент и просмотрела около 481 млн журналов. Разбираем факты без вывода, что модель действовала намеренно. Новости Модель OpenAI предложила подход к задаче Навье — Стокса: что действительно известно OpenAI опубликовала кандидатное доказательство для одной из задач тысячелетия. Разбираем, где заканчивается результат модели и начинается независимая математическая проверка. Новости Microsoft вывела MDASH в Azure Government: как 100 ИИ-агентов проверяют код Microsoft открыла предварительный доступ к многоагентному сканеру MDASH для отдельных государственных заказчиков США. Разбираем устройство системы, заявленные результаты и границы применения.
Опубликовано: 17 июня 14:00 · Обновлено: 5 сентября 2026
← На главную