Обучение с подкреплением в робототехнике: обзор
Reinforcement learning in robotics: A survey
2013-08-23
SCID: 54.1/ek2h9ptp
Discuss with AI
генерация поведениямодельно-ориентированное обучение с подкреплениембезмодельное обучение с подкреплениемметоды поиска политикиобучение с подкреплениемробототехникаметоды на основе функции ценности
Figures from the paper
Abstract (AI)
Обучение с подкреплением предоставляет робототехнике методологию и набор инструментов для разработки сложных и трудно проектируемых поведений. В то же время задачи робототехники служат источником вдохновения, имеют практическое значение и обеспечивают валидацию для развития методов обучения с подкреплением. Отношения между этими дисциплинами по своим перспективам можно сопоставить с отношением физики и математики. В этой статье мы стремимся укрепить связи между двумя исследовательскими сообществами, представив обзор работ по применению обучения с подкреплением для генерации поведения у роботов. Мы выделяем как ключевые проблемы обучения с подкреплением в робототехнике, так и заметные успехи. Обсуждается, как различные вклады помогли укротить сложность предметной области, и анализируется роль алгоритмов, представлений и априорных знаний в достижении этих успехов. В результате особое внимание в работе уделено выбору между модельными (model-based) и немодельными (model-free) подходами, а также между методами на основе функции ценности и методами поиска политики. На примере подробного анализа простой задачи мы демонстрируем, как подходы обучения с подкреплением могут быть применены с пользой, и в тексте постоянно отмечаем открытые вопросы и огромный потенциал для будущих исследований.
Key Findings
1
Основное внимание уделяется компромиссам между модельными и безмодельными методами, а также между методами на основе функции ценности и поиском политик.
2
Выделены ключевые проблемы и заметные успехи в RL для роботов, показано, как алгоритмы, представления и априорные знания уменьшают сложность домена.
3
Обучение с подкреплением (RL) предоставляет робототехнике структуру и инструменты для разработки сложных, трудно проектируемых поведений.
4
Задачи робототехники стимулируют и проверяют разработки в RL, создавая взаимовыгодные отношения между областями.
5
В обзоре проанализирована простая задача для демонстрации практического применения RL в робототехнике и отмечены открытые вопросы и потенциал для будущих исследований.
Research Object
Роботизированные системы для генерации поведения с использованием обучения с подкреплением
Research Subject
Применение и оценка методов обучения с подкреплением (модельные против немодельных; методы на основе функции значения против поиска политики), включая алгоритмы, представления, априорные знания, проблемы и успехи в генерации поведения роботов
Publication Details
Publication Date
2013-08-23
Journal
Publisher
ISSN
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest