Robostral Navigate
Robostral Navigate — первый выход Mistral AI в воплощённый ИИ (embodied AI). Это vision-language-action модель на 8 млрд параметров: на вход — картинка с одной RGB-камеры плюс инструкция обычными словами, на выход — движение робота по сложной среде. Ни лидара, ни датчиков глубины, ни массива камер не требуется — только одна обычная камера.
Главный результат — на бенчмарке R2R-CE (навигация «из комнаты в комнату» в непрерывной среде) модель показывает 76,6% успеха на невиданной ранее части и до 79,4% на валидации. Это на 9,7 процентного пункта выше лучшего подхода с одной камерой и на 4,5 пункта выше лучших систем с датчиками глубины и несколькими камерами — при том, что сама Robostral не использует ни того, ни другого.
Модель обучена целиком в симуляции — около 400 тысяч траекторий на 6 тысячах сцен — и обобщается на колёсных, шагающих и летающих роботов. Навигация по «указанию точки» дополнена обучением с подкреплением для дальнейшего улучшения.
Значение релиза не столько в конкретных цифрах, сколько в направлении: качественная навигация с дешёвого железа (одна камера вместо дорогого набора сенсоров) удешевляет робота и приближает момент, когда воплощённый ИИ выйдет из лабораторий. Оговорки честные: 8 млрд параметров — это модель под конкретную задачу навигации, а не универсальный «мозг робота»; результаты пока в основном на бенчмарках и в симуляции, а реальный мир всегда сложнее.
- ✓Навигация с ОДНОЙ обычной камеры — без лидара и датчиков глубины
- ✓Обходит на R2R-CE даже системы с несколькими камерами и сенсорами
- ✓Обобщается на колёсных, шагающих и летающих роботов
- ✓Команды обычным языком — не нужен специальный интерфейс
- ✓Удешевляет железо робота, снижая порог входа
- ✕Узкая специализация — навигация, а не универсальные действия
- ✕Результаты пока в основном на бенчмарках и в симуляции
- ✕Реальная среда сложнее полигона — перенос не гарантирован
- ✕Нужен робот и техническая интеграция — не потребительский продукт