Глубокое обучение с подкреплением: краткий обзор
Deep Reinforcement Learning: A Brief Survey
2017-11-01
SCID: 54.1/x57yw7uu
Discuss with AI
асинхронный advantage actor-criticdeep Q-network (DQN)глубокое подкрепляющее обучениеtrust region policy optimization (TRPO)визуальное подкрепляющее обучение
Figures from the paper
Abstract (AI)
Глубокое обучение с подкреплением (DRL) готово произвести революцию в области искусственного интеллекта (AI) и представляет собой шаг к созданию автономных систем с более глубоким пониманием визуального мира. В настоящее время глубокое обучение позволяет обучению с подкреплением (RL) масштабироваться до задач, которые ранее были неразрешимы, например до обучения игре в видеоигры напрямую по пикселям. Алгоритмы DRL также применяются в робототехнике, позволяя получать управляющие политики для роботов напрямую из данных с камер в реальном мире. В этом обзоре мы начинаем с введения в общую область RL, затем переходим к основным направлениям методов на основе оценки значения (value-based) и методов на основе политики (policy-based). Наш обзор охватывает ключевые алгоритмы глубокого RL, включая глубокую Q-сеть (DQN), оптимизацию в доверительной области политики (TRPO) и асинхронный метод актёр-критик с преимуществом (A3C). Параллельно мы выделяем уникальные преимущества глубоких нейронных сетей, уделяя внимание визуальному пониманию через RL. В заключение описываются несколько актуальных направлений исследований в этой области.
Key Findings
1
Алгоритмы DRL применяются в робототехнике, что позволяет обучать управляющие политики непосредственно по камерам в реальном мире.
2
Глубокие нейронные сети дают уникальные преимущества в визуальном понимании в сочетании с RL, поддерживая более высокий уровень восприятия для автономных систем.
3
Глубокое подкрепляющее обучение (DRL) позволяет масштабировать RL на ранее неразрешимые задачи, например обучение игре по пикселям.
4
Статья описывает несколько текущих областей исследований в глубоком подкрепляющем обучении как направления для будущей работы.
5
Обзор структурирован по основным направлениям DRL: методы на основе ценности и политики, рассматриваются ключевые алгоритмы DQN, TRPO и A3C.
Research Object
Глубокое обучение с подкреплением (Deep Reinforcement Learning, DRL) как область исследования и набор алгоритмов
Research Subject
Ключевые алгоритмы, методы и возможности DRL — включая методы на основе ценности и политики (например, DQN, TRPO, A3C), использование глубоких нейронных сетей для визуального понимания, масштабирование RL на входы высокой размерности и применения (например, игры и управление роботами)
Publication Details
Publication Date
2017-11-01
Journal
Publisher
ISSN
Access Type
Author Information
Download PDF
Subscribe to digest