NaVILA: Модель Зрение–Язык–Действие для навигации ногоподобного робота
NaVILA: Legged Robot Vision-Language-Action Model for Navigation
2024-12-05
SCID: 54.1/88r8rghu
Discuss with AI
Vision-Language-Action (VLA)Навигация по зрению и языкушестиногие/ноговые роботыгенерация среднеуровневых действийRL-политика визуальной локомоции
Figures from the paper
Abstract (AI)
В статье предлагается решение задачи Vision-and-Language Navigation для ногоподобных роботов, что не только обеспечивает гибкий способ управления человеком, но и позволяет роботу перемещаться по более сложным и загроможденным сценам. Перевод человеческих языковых инструкций в низкоуровневые действия суставов ног является нетривиальной задачей. Мы предлагаем NaVILA — двухуровневую архитектуру, объединяющую модель «Зрение–Язык–Действие» (VLA) с навыками локомоции. Вместо прямого предсказания низкоуровневых действий из VLA, NaVILA сначала генерирует среднеуровневые действия со пространственной информацией в виде языка (например, «движение вперед на 75 см»), которые служат входом для визуальной политики локомоции, обученной с помощью методов усиленного обучения, для выполнения. NaVILA существенно превосходит предыдущие подходы на существующих бенчмарках. Те же преимущества продемонстрированы в наших новых бенчмарках в IsaacLab, которые характеризуются более реалистичными сценами, низкоуровневым управлением и реальными роботехническими экспериментами. Дополнительные результаты доступны на https://navila-bot.github.io/
Key Findings
1
Среднеуровневые действия в языковой форме используются как вход для обученной с подкреплением визуальной политики локомоции, которая выполняет низкоуровневое управление.
2
NaVILA генерирует среднеуровневые действия, выраженные в пространственном языке (например, «двигаться вперед на 75 см»), вместо прямого предсказания низкоуровневых суставных команд.
3
NaVILA — это двухуровневая структура, объединяющая модель «визуализация-язык-действие» с навыками локомоции для навигации шагающих роботов.
4
NaVILA значительно превосходит предыдущие подходы на существующих бенчмарках по навигации с визуально-языковыми инструкциями.
5
Преимущества NaVILA продемонстрированы на новых бенчмарках IsaacLab с более реалистичными сценами, низкоуровневым управлением и реальными экспериментами на роботе.
Research Object
Ноги́й робот, выполняющий навигацию по визуальным и языковым указаниям с помощью двухуровневой модели Vision-Language-Action (NaVILA)
Research Subject
Генерация промежуточных языковых пространственных действий из визуально-языковых инструкций и их интеграция с визуальной локомоционной RL-политикой для преобразования команд человека в низкоуровневое управление суставами ног для навигации
Publication Details
Publication Date
2024-12-05
Journal
Publisher
ISSN
Cited by
2
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest