NaVILA: Модель Зрение–Язык–Действие для навигации ногоподобного робота

NaVILA: Legged Robot Vision-Language-Action Model for Navigation
An-Chieh Cheng, Yandong Ji, Zhaojing Yang, Xueyan Zou, Jan Kautz, Erdem Bıyık, Hongxu Yin, Sifei Liu, Xiaolong Wang, Wang, Xiaolong, An‐Chieh Cheng, Gongye, Zaitian
2024-12-05

Vision-Language-Action (VLA)Навигация по зрению и языкушестиногие/ноговые роботыгенерация среднеуровневых действийRL-политика визуальной локомоции
В статье предлагается решение задачи Vision-and-Language Navigation для ногоподобных роботов, что не только обеспечивает гибкий способ управления человеком, но и позволяет роботу перемещаться по более сложным и загроможденным сценам. Перевод человеческих языковых инструкций в низкоуровневые действия суставов ног является нетривиальной задачей. Мы предлагаем NaVILA — двухуровневую архитектуру, объединяющую модель «Зрение–Язык–Действие» (VLA) с навыками локомоции. Вместо прямого предсказания низкоуровневых действий из VLA, NaVILA сначала генерирует среднеуровневые действия со пространственной информацией в виде языка (например, «движение вперед на 75 см»), которые служат входом для визуальной политики локомоции, обученной с помощью методов усиленного обучения, для выполнения. NaVILA существенно превосходит предыдущие подходы на существующих бенчмарках. Те же преимущества продемонстрированы в наших новых бенчмарках в IsaacLab, которые характеризуются более реалистичными сценами, низкоуровневым управлением и реальными роботехническими экспериментами. Дополнительные результаты доступны на https://navila-bot.github.io/
1
Среднеуровневые действия в языковой форме используются как вход для обученной с подкреплением визуальной политики локомоции, которая выполняет низкоуровневое управление.
2
NaVILA генерирует среднеуровневые действия, выраженные в пространственном языке (например, «двигаться вперед на 75 см»), вместо прямого предсказания низкоуровневых суставных команд.
3
NaVILA — это двухуровневая структура, объединяющая модель «визуализация-язык-действие» с навыками локомоции для навигации шагающих роботов.
4
NaVILA значительно превосходит предыдущие подходы на существующих бенчмарках по навигации с визуально-языковыми инструкциями.
5
Преимущества NaVILA продемонстрированы на новых бенчмарках IsaacLab с более реалистичными сценами, низкоуровневым управлением и реальными экспериментами на роботе.

Ноги́й робот, выполняющий навигацию по визуальным и языковым указаниям с помощью двухуровневой модели Vision-Language-Action (NaVILA)

Генерация промежуточных языковых пространственных действий из визуально-языковых инструкций и их интеграция с визуальной локомоционной RL-политикой для преобразования команд человека в низкоуровневое управление суставами ног для навигации

Publication Details
Publication Date
2024-12-05
Journal
Publisher
ISSN
Cited by
2
Access Type
Author Information
Authors
An-Chieh Cheng
Yandong Ji
Zhaojing Yang
Xueyan Zou
Jan Kautz
Erdem Bıyık
Hongxu Yin
Sifei Liu
Xiaolong Wang
Wang, Xiaolong
An‐Chieh Cheng
Gongye, Zaitian
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%