Qwen‑Drive 1.0‑4B: карточка открытой модели для автономного вождения
Qwen‑Drive 1.0‑4B — открытая мультимодальная модель для исследований автономного вождения. Она построена вокруг Qwen3.5‑4B и объединяет три задачи: понимание дорожной сцены на естественном языке, трёхмерное восприятие и планирование будущей траектории автомобиля. Веса, конфигурация, демонстрационные данные и код опубликованы по Apache 2.0. Это серьёзная исследовательская основа, но не готовый водитель и не программное обеспечение, которое можно подключить к реальной машине без отдельной системы безопасности.
Как устроена модель
Общая vision-language модель принимает изображения и текст. К ней подключены два специализированных модуля. BEV-голова строит представление сцены с высоты: обнаруживает объекты в 3D, оценивает занятость пространства и сегментирует элементы карты. Planning Expert использует общие представления и генерирует будущую траекторию методом flow matching.
Архитектура интересна тем, что базовую VLM не переделывали. Специализированные головы добавлены вокруг неё, а обучение проходило поэтапно на дорожных и общих визуально-языковых данных. Авторы пытаются сохранить способность отвечать на свободные вопросы и одновременно научить систему геометрии и движению.
Что значит «4B»
Число в названии относится к базовому масштабу Qwen3.5‑4B, однако репозиторий включает дополнительные головы и конфигурации. На странице Hugging Face общий размер отображается примерно как пять миллиардов параметров. Поэтому при оценке памяти нельзя ориентироваться только на слово 4B. Нужны точный набор файлов, режим точности и выбранный эксперт.
Для полного запуска планировщика модель загружается вместе с planning-модулем и переносится на GPU. Репозиторий предлагает варианты SFT и RL. Это не обычный чат, который достаточно открыть через универсальный интерфейс. Нужны зависимости проекта, формат данных сцены и понимание выходной траектории.
Какие результаты заявлены
Авторы приводят оценки WOD‑E2E и PAI‑AV для открытого планирования. В таблице версии после обучения с подкреплением и supervised-настройки по-разному ведут себя на метриках расстояния и качества траектории. Это полезно: нет одной версии, побеждающей во всех условиях.
Но open-loop тест не показывает, что произойдёт после исполнения движения. Прогноз оценивается на записанной сцене, а собственное действие автомобиля не меняет окружающий мир. В закрытом цикле ошибка поворота влияет на следующий кадр и может накапливаться. Поэтому бенчмарк подтверждает способность на данных, но не безопасность управления.
Как проверить модель без реального автомобиля
Начните с опубликованных демонстрационных сцен и воспроизведите заявленный запуск. Зафиксируйте коммит кода, хэш весов, GPU и параметры. Затем подготовьте локальную разрешённую выборку с погодой, сумерками, перекрытиями объектов и редкой дорожной разметкой. Не подбирайте только красивые случаи.
Сравнивайте не только траекторию. Проверьте 3D-объекты, карту занятости и ответы VQA на одну сцену. Если языковая часть говорит, что путь свободен, а BEV-голова видит препятствие, система должна показать конфликт, а не скрыть его усреднением. Общую природу таких моделей объясняет статья что такое VLA и модели для роботов.
Где возможна практическая польза
Qwen‑Drive подходит лабораториям, разработчикам симуляторов и командам, исследующим совместное обучение восприятия и планирования. Она может служить воспроизводимой базой для сравнения голов, данных и способов адаптации. Небольшой относительно автомобильных систем масштаб снижает порог эксперимента.
Модель также интересна как пример объединения языка и физической сцены. Исследователь может спрашивать о дорожном контексте, анализировать, какие признаки использовались, и сопоставлять объяснение с геометрическим выходом. Но свободный ответ не считается объяснением траектории, если не подтверждён внутренними сигналами и тестом.
Лицензия и данные
Apache 2.0 разрешает широкое использование кода и весов, но не снимает обязательств по данным, патентам, приватности и отраслевым нормам. Кадры с номерами, лицами и точными координатами требуют отдельной политики. Условия каждого внешнего набора проверяются независимо от лицензии модели.
Рядом полезно держать объяснение лицензий открытых моделей. Формулировка «open weights» не является сертификатом качества или безопасности.
Ограничения
Модель уязвима к смене камер, калибровки, погоды и географии. Визуально-языковая часть может уверенно описать несуществующую деталь. Планировщик оптимизирован по конкретным данным и метрикам. Ни одна из этих проблем не решается длинным системным промптом.
Для закрытого цикла нужны симуляция, резервный контроллер, проверка ограничений траектории и аварийная остановка. Сначала тестируют ситуации без людей и физического риска. Подход к безопасному расширению прав похож на проверку физического ИИ: способности модели отделяются от исполнительного контура.
Вердикт
Qwen‑Drive 1.0‑4B ценна как открытая исследовательская система, где язык, 3D-восприятие и планирование можно изучать вместе. Её сильные стороны — доступные веса, Apache 2.0 и модульная архитектура. Слабые — зависимость от дорожных данных и разрыв между open-loop метрикой и реальным управлением.
Добавлять модель в автомобиль нельзя на основании таблицы. Добавлять её в симулятор и честный воспроизводимый тест — можно и полезно.
FAQ
Qwen‑Drive может управлять обычным автомобилем?
Нет. Репозиторий предназначен для исследований. Реальное управление требует сертифицированного контура, сенсоров, резервирования и большого комплекса испытаний.
Почему в названии 4B, а репозиторий показывает больший размер?
4B обозначает базовую VLM. Полная система содержит дополнительные головы восприятия и планирования.
Модель полностью открыта?
Веса и код опубликованы по Apache 2.0. Лицензии данных и требования конкретного применения проверяются отдельно.
Где начинать тест?
С воспроизведения официального примера и симулятора, без соединения с исполнительными механизмами реального автомобиля.