Что такое VLA-модели: как нейросеть учится двигать руками, а не писать текст
Языковая модель отвечает текстом. Модель для картинок отвечает картинкой. А что должна выдать модель, управляющая роботом? Ответ неочевиден — и именно в нём главная сложность целого направления, которое называют VLA.
Расшифровка
VLA — vision-language-action, «зрение-язык-действие». Три слова описывают всю цепочку:
- vision — модель видит: камера робота даёт картинку;
- language — модель понимает команду на обычном языке: «убери красную кружку со стола»;
- action — модель выдаёт действие: конкретные углы поворота суставов, скорости, положения захвата.
Последний пункт и есть принципиальное отличие от всего остального. Чат-бот выдаёт токены, которые читает человек. VLA выдаёт числа, которые исполняет мотор, — десятки раз в секунду, непрерывно.
Почему это сложнее, чем кажется
Три причины, из-за которых робототехника отстаёт от текстовых моделей на несколько лет.
Ошибку нельзя переписать. Неудачный абзац вы просто перегенерируете. Робот, уронивший чашку, уже разбил чашку — отменить нечего.
Данных мало и они дорогие. Текстов в интернете триллионы. А записей «как рука робота берёт предмет» нужно набирать вручную: сажать оператора, давать ему манипулятор и снимать часами. Каждый час данных стоит реальных денег.
Физический мир не прощает приблизительности. Модель может «примерно» понять смысл абзаца — и это нормально. «Примерно» взять стакан означает разлитую воду.
Как устроена современная VLA
Разберём на примере Isaac GR00T N1.7 от NVIDIA — одной из немногих открытых моделей этого класса.
Внутри работают две системы в связке:
- Медленная и умная (на базе Cosmos-Reason2). Смотрит на картинку и на команду, разбирается: что перед нами, где нужный объект, в каком порядке действовать. По сути — обычная мультимодальная модель.
- Быстрая и точная — 32-слойный диффузионный трансформер. Переводит намерение в конкретную траекторию движения.
Разделение не случайно: рассуждать нужно раз в секунду, а управлять моторами — десятки раз в секунду. Одна модель обе задачи тянуть не может.
Размер такой модели — 3 млрд параметров. Для сравнения, современные языковые модели — сотни миллиардов и триллионы. Причина проста: модель должна работать прямо на роботе, на компактной плате, без связи с облаком.
Видео от первого лица
Самая интересная часть — откуда берут данные, которых мало.
Метод EgoScale в GR00T использовал 20 854 часа видео от первого лица: как люди работают руками на производстве, в рознице, в здравоохранении. Не записи роботов — записи людей, снятые с камеры на голове.
Логика в том, что человеческая рука и манипулятор решают одну задачу, и общие закономерности переносятся: как подходить к предмету, под каким углом брать, как удерживать.
При этом обнаружилась закономерность, которую назвали первым законом масштабирования ловкости: рост обучающего видео с 1 000 до 20 000 часов более чем удвоил долю успешно выполненных задач. Проще говоря, здесь работает то же правило, что и в языковых моделях: больше данных — заметно лучше результат. До этого не было очевидно, что оно распространяется и на физические действия.
Чем VLA отличается от «робота с ИИ» в рекламе
Разграничение, которое стоит держать в голове.
| Обычная автоматизация | VLA-модель | |
|---|---|---|
| Как задаётся задача | Программируется по шагам | Формулируется словами |
| Новый предмет | Нужно перепрограммировать | Пробует справиться сама |
| Изменилась обстановка | Сбой | Адаптируется (иногда) |
| Предсказуемость | Полная | Вероятностная |
Промышленный робот на конвейере десятилетиями работает без всякого ИИ — и делает это надёжнее любой нейросети, потому что выполняет одно и то же движение. VLA нужны там, где обстановка меняется: склад с разными коробками, кухня, уход за человеком.
Обратная сторона — та же, что у чат-ботов: вероятностность. VLA-модель может ошибиться, и предсказать заранее, когда именно, нельзя.
Где это уже применяют
Честная картина на середину 2026 года: массового применения нет, есть пилоты и исследования.
Реально работает:
- склады и логистика — сортировка разнородных предметов;
- производство — операции, где деталь каждый раз лежит немного иначе;
- лаборатории — рутинные манипуляции с образцами.
Пока не работает: домашние роботы, уход за людьми, всё, где цена ошибки — здоровье человека.
Государства при этом делают на направление серьёзные ставки: Япония планирует 10 млн роботов с ИИ к 2040 году и вкладывает $65 млрд.
Что запомнить
- VLA = зрение + язык + действие: модель выдаёт движения, а не текст.
- Главное отличие от чат-бота — выход исполняет мотор, а не читает человек.
- Устроены как две системы: медленная рассуждает, быстрая управляет.
- Модели компактные (миллиарды, а не сотни миллиардов) — работают на роботе.
- Учат на видео от первого лица, в том числе на записях работы людей.
- Закон масштабирования ловкости: 1k→20k часов данных более чем удвоили успех.
- Массового применения пока нет — пилоты, склады, производство.
Как физический ИИ развивается в целом — в материале про обучение роботов. Что происходит с ценами на железо, без которого это невозможно, — здесь.