ИИ ИИшка Про
Гайды

Что такое VLA-модели: как нейросеть учится двигать руками, а не писать текст

AI-редакция

Языковая модель отвечает текстом. Модель для картинок отвечает картинкой. А что должна выдать модель, управляющая роботом? Ответ неочевиден — и именно в нём главная сложность целого направления, которое называют VLA.

Расшифровка

VLA — vision-language-action, «зрение-язык-действие». Три слова описывают всю цепочку:

  • vision — модель видит: камера робота даёт картинку;
  • language — модель понимает команду на обычном языке: «убери красную кружку со стола»;
  • action — модель выдаёт действие: конкретные углы поворота суставов, скорости, положения захвата.

Последний пункт и есть принципиальное отличие от всего остального. Чат-бот выдаёт токены, которые читает человек. VLA выдаёт числа, которые исполняет мотор, — десятки раз в секунду, непрерывно.

Почему это сложнее, чем кажется

Три причины, из-за которых робототехника отстаёт от текстовых моделей на несколько лет.

Ошибку нельзя переписать. Неудачный абзац вы просто перегенерируете. Робот, уронивший чашку, уже разбил чашку — отменить нечего.

Данных мало и они дорогие. Текстов в интернете триллионы. А записей «как рука робота берёт предмет» нужно набирать вручную: сажать оператора, давать ему манипулятор и снимать часами. Каждый час данных стоит реальных денег.

Физический мир не прощает приблизительности. Модель может «примерно» понять смысл абзаца — и это нормально. «Примерно» взять стакан означает разлитую воду.

Как устроена современная VLA

Разберём на примере Isaac GR00T N1.7 от NVIDIA — одной из немногих открытых моделей этого класса.

Внутри работают две системы в связке:

  1. Медленная и умная (на базе Cosmos-Reason2). Смотрит на картинку и на команду, разбирается: что перед нами, где нужный объект, в каком порядке действовать. По сути — обычная мультимодальная модель.
  2. Быстрая и точная — 32-слойный диффузионный трансформер. Переводит намерение в конкретную траекторию движения.

Разделение не случайно: рассуждать нужно раз в секунду, а управлять моторами — десятки раз в секунду. Одна модель обе задачи тянуть не может.

Размер такой модели — 3 млрд параметров. Для сравнения, современные языковые модели — сотни миллиардов и триллионы. Причина проста: модель должна работать прямо на роботе, на компактной плате, без связи с облаком.

Видео от первого лица

Самая интересная часть — откуда берут данные, которых мало.

Метод EgoScale в GR00T использовал 20 854 часа видео от первого лица: как люди работают руками на производстве, в рознице, в здравоохранении. Не записи роботов — записи людей, снятые с камеры на голове.

Логика в том, что человеческая рука и манипулятор решают одну задачу, и общие закономерности переносятся: как подходить к предмету, под каким углом брать, как удерживать.

При этом обнаружилась закономерность, которую назвали первым законом масштабирования ловкости: рост обучающего видео с 1 000 до 20 000 часов более чем удвоил долю успешно выполненных задач. Проще говоря, здесь работает то же правило, что и в языковых моделях: больше данных — заметно лучше результат. До этого не было очевидно, что оно распространяется и на физические действия.

Чем VLA отличается от «робота с ИИ» в рекламе

Разграничение, которое стоит держать в голове.

Обычная автоматизацияVLA-модель
Как задаётся задачаПрограммируется по шагамФормулируется словами
Новый предметНужно перепрограммироватьПробует справиться сама
Изменилась обстановкаСбойАдаптируется (иногда)
ПредсказуемостьПолнаяВероятностная

Промышленный робот на конвейере десятилетиями работает без всякого ИИ — и делает это надёжнее любой нейросети, потому что выполняет одно и то же движение. VLA нужны там, где обстановка меняется: склад с разными коробками, кухня, уход за человеком.

Обратная сторона — та же, что у чат-ботов: вероятностность. VLA-модель может ошибиться, и предсказать заранее, когда именно, нельзя.

Где это уже применяют

Честная картина на середину 2026 года: массового применения нет, есть пилоты и исследования.

Реально работает:

  • склады и логистика — сортировка разнородных предметов;
  • производство — операции, где деталь каждый раз лежит немного иначе;
  • лаборатории — рутинные манипуляции с образцами.

Пока не работает: домашние роботы, уход за людьми, всё, где цена ошибки — здоровье человека.

Государства при этом делают на направление серьёзные ставки: Япония планирует 10 млн роботов с ИИ к 2040 году и вкладывает $65 млрд.

Что запомнить

  • VLA = зрение + язык + действие: модель выдаёт движения, а не текст.
  • Главное отличие от чат-бота — выход исполняет мотор, а не читает человек.
  • Устроены как две системы: медленная рассуждает, быстрая управляет.
  • Модели компактные (миллиарды, а не сотни миллиардов) — работают на роботе.
  • Учат на видео от первого лица, в том числе на записях работы людей.
  • Закон масштабирования ловкости: 1k→20k часов данных более чем удвоили успех.
  • Массового применения пока нет — пилоты, склады, производство.

Как физический ИИ развивается в целом — в материале про обучение роботов. Что происходит с ценами на железо, без которого это невозможно, — здесь.