Управление автомобилем с помощью больших языковых моделей: объединение векторной модальности на уровне объектов для объяснимого автономного вождения
Driving with LLMs: Fusing Object-Level Vector Modality for Explainable Autonomous Driving
2024-05-13
SCID: 54.1/yhnbvh5j
Discuss with AI
вопросы и ответы по вождениюповеденческое клонированиеобъяснимое автономное вождениеобъектно-уровневая мультимодальная LLMвекторизованные числовые модальности
Figures from the paper
Abstract (AI)
Большие языковые модели (LLM) продемонстрировали перспективность в сфере автономного вождения, особенно с точки зрения обобщения и интерпретируемости. Мы представляем уникальную мультимодальную архитектуру LLM на уровне объектов, объединяющую векторизованные числовые модальности с предварительно обученной LLM для улучшения понимания контекста в дорожных ситуациях. Мы также представляем новый набор данных, содержащий 160 тыс. пар «вопрос–ответ» (QA), полученных из 10 тыс. сценариев вождения и дополненных высококачественными командами управления, собранными с помощью агента обучения с подкреплением, а также парами «вопрос–ответ», сгенерированными учительской LLM (GPT-3.5). Разработана специальная стратегия предварительного обучения для согласования числовых векторных модальностей со статическими представлениями LLM с использованием языковых данных для описания векторов. Кроме того, мы вводим метрику оценки для Driving QA и демонстрируем способность нашего LLM-водителя интерпретировать дорожные ситуации, отвечать на вопросы и принимать решения. Полученные результаты подчеркивают потенциал генерации действий вождения на основе LLM по сравнению с традиционным поведенческим клонированием. Мы предоставляем наш бенчмарк, наборы данных и модель для дальнейшего изучения.
Key Findings
1
Разработана стратегия предварительного обучения на основе векторного описания, выравнивающая числовые векторные представления со статическими представлениями предварительно обученной LLM.
2
Предложена специализированная метрика Driving QA; показана способность модели интерпретировать дорожные сценарии, отвечать на вопросы и принимать решения о вождении.
3
Представлена объектно-ориентированная мультимодальная архитектура LLM, объединяющая векторизованные числовые данные о вождении с предварительно обученной языковой моделью для улучшения понимания контекста.
4
Опубликован набор данных из 160 000 пар «вопрос–ответ» для 10 000 дорожных сценариев, дополненный командами управления от агента с обучением с подкреплением и ответами, сгенерированными GPT-3.5.
5
Продемонстрирован потенциал генерации действий вождения на основе LLM по сравнению с традиционным поведенческим клонированием; benchmark, наборы данных и модель опубликованы для дальнейших исследований.
Research Object
мультимодальная система автономного вождения на базе LLM с объектно-ориентированным представлением
Research Subject
понимание контекста, объяснимые ответы на вопросы о вождении и генерация управляющих действий на основе векторизованных модальностей дорожной сцены
Publication Details
Publication Date
2024-05-13
Journal
Publisher
ISSN
Cited by
175
Access Type
Author Information
Download PDF
Subscribe to digest