Диагностика непериодических аномалий при выполнении политик обучения с подкреплением (краткое сообщение)

Diagnosing Non-Intermittent Anomalies in Reinforcement Learning Policy Executions (Short Paper)
John Schulman, Filip Wolski, Prafulla Dhariwal, Natan, Avraham, Stern, Roni, Kalech, Meir, Esper, Khalil, Spieck, Jan, Sixdenier, Pierre-Louis, Wildermann, Stefan, Teich, Jürgen
2017-07-20

дивергенция Дженсена—Шеннонаавтоэнкодер измеренийуправление полётом октокоптераконтроллер обучения с подкреплениемперенос из симуляции в реальный мир
Из-за рисков для безопасности и неэффективного использования обучающих выборок контроллеры часто предпочтительно разрабатывать в симуляции. Однако небольшие различия между симуляцией и реальным миром могут приводить к значительному разрыву между симуляцией и реальностью, снижая эффективность разработанного контроллера. В данной работе рассматривается пример переноса контроллера октокоптера, основанного на обучении с подкреплением, из симуляции в реальный мир. Сначала эффективность переноса в реальный мир оценивается с использованием показателей безопасности. Установлено, что, хотя во время реальных полётов наблюдается заметное увеличение отклонения (примерно на 100%), это отклонение может не считаться опасным, поскольку оно остаётся в пределах коридоров безопасности > 2 м. Затем оцениваются плотности распределений измерений и сравниваются дивергенции Йенсена—Шеннона для смоделированных и реальных измерений. Показано, что ориентация аппарата существенно различается в симулированных и реальных полётах. Это связывается с иным режимом полёта в реальных условиях, при котором аппарат разворачивается лицом к следующей путевой точке. Также установлено, что действия контроллера обучения с подкреплением, по-видимому, корректно компенсируют возмущающие силы. Далее анализируются ошибки автоэнкодера измерений и нейронной сети модели переходов состояний, применённых к реальным данным. Обнаружено, что эти модели дополнительно подтверждают различие между управлением ориентацией в симуляции и в реальности, демонстрируя ошибки непосредственно на траекториях полёта. В заключение обсуждаются важные выводы, полученные при переносе контроллера из симуляции в реальный мир.
1
При переносе контроллера октокоптера с подкреплением из симуляции в реальные полёты отклонение увеличилось примерно на 100%, но осталось в пределах безопасных коридоров шириной более 2 м.
2
Анализ дивергенции Дженсена—Шеннона показал значительные различия распределений ориентации аппарата между симулированными и реальными полётами.
3
Ошибки автоэнкодера измерений и нейросетевой модели переходов состояний на реальных данных подтвердили и визуально локализовали различия управления ориентацией вдоль траекторий полёта.
4
В реальных полётах аппарат использовал иной режим управления, разворачиваясь лицом к следующей путевой точке, что, вероятно, вызвало несоответствие управления ориентацией.
5
Действия контроллера с подкреплением, по-видимому, корректно компенсировали возмущающие силы несмотря на различия между симуляцией и реальностью.

Контроллер полёта окторотора, обученный с использованием обучения с подкреплением, перенесённый из симуляции в реальные полёты

эффективность переноса из симуляции в реальный мир и неинтермиттирующие аномалии в поведении контроллера при полёте, включая отклонения по показателям безопасности, различия в ориентации и ошибки управления ориентацией

Publication Details
Publication Date
2017-07-20
Journal
Publisher
ISSN
Access Type
Author Information
Authors
John Schulman
Filip Wolski
Prafulla Dhariwal
Natan, Avraham
Stern, Roni
Kalech, Meir
Esper, Khalil
Spieck, Jan
Sixdenier, Pierre-Louis
Wildermann, Stefan
Teich, Jürgen
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%