Обучение с подкреплением для интеллектуального и автономного управления производством на сложных мелкосерийных производствах с учетом временных ограничений
Reinforcement learning for an intelligent and autonomous production control of complex job-shops under time constraints
2020-06-01
SCID: 54.1/82h6raf5
Discuss with AI
Q-обучениедискретно-событийное моделированиедиспетчеризация заказовуправление производствомобучение с подкреплением
Figures from the paper
Abstract (AI)
Обучение с подкреплением (ОП) открывает перспективные возможности для решения проблемы постоянно возрастающей сложности управления современными производственными системами. Мы применяем алгоритм Q-обучения в сочетании с процессно-ориентированным дискретно-событийным моделированием для обучения самообучающегося, интеллектуального и автономного агента решению задачи диспетчеризации заказов в сложном мелкосерийном производстве со строгими временными ограничениями. Впервые обучение с подкреплением в управлении производством объединено со строгими временными ограничениями. Моделирование отражает характеристики сложных мелкосерийных производств, типичных для полупроводниковой промышленности. С использованием разработанной и реализованной программной платформы рассмотрен практический сценарий из производства полупроводниковых пластин. Сравниваются показатели метода обучения с подкреплением и эталонных эвристик. Показано, что обучение с подкреплением может успешно применяться для диспетчеризации заказов в сложной среде с временными ограничениями. Агент обучения с подкреплением с функцией выигрыша, поощряющей выбор наименее критичного с точки зрения временных ограничений заказа, превосходит эвристические правила, выбирая в первую очередь наиболее критичную партию. Таким образом, данная работа демонстрирует, что самообучающийся агент способен успешно управлять временными ограничениями и превосходить традиционный эталонный метод — эвристику учета временных ограничений, объединяющую отклонения от сроков выполнения заказов с классическим подходом «первым поступил — первым обслужен».
Key Findings
1
Агент Q-обучения в сочетании с процессной имитацией дискретных событий был обучен для автономной диспетчеризации заказов в сложных цехах.
2
Агент RL, поощрявший выбор наименее критичного по времени заказа, превзошёл эвристическое правило приоритизации наиболее критичной партии.
3
Обучение с подкреплением успешно решало задачу диспетчеризации заказов в сложной производственной среде с временными ограничениями.
4
Подход RL превзошёл базовую эвристику, объединяющую отклонения от сроков поставки и классический принцип FIFO.
5
Предложенная система учитывает жёсткие временные ограничения в управлении производством и продемонстрирована на характеристиках производств полупроводников и реальном примере вафельной фабрики.
Research Object
производственные системы типа сложного job shop в производстве полупроводниковых пластин со строгими временными ограничениями
Research Subject
эффективность и принятие решений при автономной диспетчеризации заказов на основе обучения с подкреплением в условиях строгих временных ограничений
Publication Details
Publication Date
2020-06-01
Journal
Publisher
ISSN
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest