Глубокое обучение с подкреплением: краткий обзор

Deep Reinforcement Learning: A Brief Survey
Miles Brundage, Marc Peter Deisenroth, Kai Arulkumaran, Anil A. Bharath
2017-11-01

асинхронный advantage actor-criticdeep Q-network (DQN)глубокое подкрепляющее обучениеtrust region policy optimization (TRPO)визуальное подкрепляющее обучение
Глубокое обучение с подкреплением (DRL) готово произвести революцию в области искусственного интеллекта (AI) и представляет собой шаг к созданию автономных систем с более глубоким пониманием визуального мира. В настоящее время глубокое обучение позволяет обучению с подкреплением (RL) масштабироваться до задач, которые ранее были неразрешимы, например до обучения игре в видеоигры напрямую по пикселям. Алгоритмы DRL также применяются в робототехнике, позволяя получать управляющие политики для роботов напрямую из данных с камер в реальном мире. В этом обзоре мы начинаем с введения в общую область RL, затем переходим к основным направлениям методов на основе оценки значения (value-based) и методов на основе политики (policy-based). Наш обзор охватывает ключевые алгоритмы глубокого RL, включая глубокую Q-сеть (DQN), оптимизацию в доверительной области политики (TRPO) и асинхронный метод актёр-критик с преимуществом (A3C). Параллельно мы выделяем уникальные преимущества глубоких нейронных сетей, уделяя внимание визуальному пониманию через RL. В заключение описываются несколько актуальных направлений исследований в этой области.
1
Алгоритмы DRL применяются в робототехнике, что позволяет обучать управляющие политики непосредственно по камерам в реальном мире.
2
Глубокие нейронные сети дают уникальные преимущества в визуальном понимании в сочетании с RL, поддерживая более высокий уровень восприятия для автономных систем.
3
Глубокое подкрепляющее обучение (DRL) позволяет масштабировать RL на ранее неразрешимые задачи, например обучение игре по пикселям.
4
Статья описывает несколько текущих областей исследований в глубоком подкрепляющем обучении как направления для будущей работы.
5
Обзор структурирован по основным направлениям DRL: методы на основе ценности и политики, рассматриваются ключевые алгоритмы DQN, TRPO и A3C.

Глубокое обучение с подкреплением (Deep Reinforcement Learning, DRL) как область исследования и набор алгоритмов

Ключевые алгоритмы, методы и возможности DRL — включая методы на основе ценности и политики (например, DQN, TRPO, A3C), использование глубоких нейронных сетей для визуального понимания, масштабирование RL на входы высокой размерности и применения (например, игры и управление роботами)

Publication Details
Publication Date
2017-11-01
Journal
Publisher
ISSN
Access Type
Author Information
Authors
Miles Brundage
Marc Peter Deisenroth
Kai Arulkumaran
Anil A. Bharath
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%