Управление автомобилем с помощью больших языковых моделей: объединение векторной модальности на уровне объектов для объяснимого автономного вождения

Driving with LLMs: Fusing Object-Level Vector Modality for Explainable Autonomous Driving
Long Chen, Oleg Sinavski, Jan Hünermann, Alice Karnsund, Andrew James Willmott, Danny Birch, Daniel Maund, Jamie Shotton
2024-05-13

вопросы и ответы по вождениюповеденческое клонированиеобъяснимое автономное вождениеобъектно-уровневая мультимодальная LLMвекторизованные числовые модальности
Большие языковые модели (LLM) продемонстрировали перспективность в сфере автономного вождения, особенно с точки зрения обобщения и интерпретируемости. Мы представляем уникальную мультимодальную архитектуру LLM на уровне объектов, объединяющую векторизованные числовые модальности с предварительно обученной LLM для улучшения понимания контекста в дорожных ситуациях. Мы также представляем новый набор данных, содержащий 160 тыс. пар «вопрос–ответ» (QA), полученных из 10 тыс. сценариев вождения и дополненных высококачественными командами управления, собранными с помощью агента обучения с подкреплением, а также парами «вопрос–ответ», сгенерированными учительской LLM (GPT-3.5). Разработана специальная стратегия предварительного обучения для согласования числовых векторных модальностей со статическими представлениями LLM с использованием языковых данных для описания векторов. Кроме того, мы вводим метрику оценки для Driving QA и демонстрируем способность нашего LLM-водителя интерпретировать дорожные ситуации, отвечать на вопросы и принимать решения. Полученные результаты подчеркивают потенциал генерации действий вождения на основе LLM по сравнению с традиционным поведенческим клонированием. Мы предоставляем наш бенчмарк, наборы данных и модель для дальнейшего изучения.
1
Разработана стратегия предварительного обучения на основе векторного описания, выравнивающая числовые векторные представления со статическими представлениями предварительно обученной LLM.
2
Предложена специализированная метрика Driving QA; показана способность модели интерпретировать дорожные сценарии, отвечать на вопросы и принимать решения о вождении.
3
Представлена объектно-ориентированная мультимодальная архитектура LLM, объединяющая векторизованные числовые данные о вождении с предварительно обученной языковой моделью для улучшения понимания контекста.
4
Опубликован набор данных из 160 000 пар «вопрос–ответ» для 10 000 дорожных сценариев, дополненный командами управления от агента с обучением с подкреплением и ответами, сгенерированными GPT-3.5.
5
Продемонстрирован потенциал генерации действий вождения на основе LLM по сравнению с традиционным поведенческим клонированием; benchmark, наборы данных и модель опубликованы для дальнейших исследований.

мультимодальная система автономного вождения на базе LLM с объектно-ориентированным представлением

понимание контекста, объяснимые ответы на вопросы о вождении и генерация управляющих действий на основе векторизованных модальностей дорожной сцены

Publication Details
Publication Date
2024-05-13
Journal
Publisher
ISSN
Cited by
175
Access Type
Author Information
Authors
Long Chen
Oleg Sinavski
Jan Hünermann
Alice Karnsund
Andrew James Willmott
Danny Birch
Daniel Maund
Jamie Shotton
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%