Политики «сначала ε» для многоруких бандитов с ограниченным бюджетом

Epsilon–First Policies for Budget–Limited Multi-Armed Bandits
Long Tran-Thanh, Archie C. Chapman, Enrique Muñoz de Cote, Alex D. Rogers, Nicholas R. Jennings
2010-07-04

границы потерь в многоруких бандитахмногорукие бандиты с ограниченным бюджетомалгоритм epsilon-firstкомпромисс исследования и эксплуатацииоценка вознаграждений и затрат
Мы вводим модель многорукого бандита (MAB) с ограниченным бюджетом, описывающую ситуации, в которых действия обучающегося являются затратными и ограничены фиксированным бюджетом, несоизмеримым с вознаграждениями, получаемыми от бандитного автомата, а также описываем первый алгоритм решения этой задачи. Поскольку обучающийся располагает ограниченным бюджетом, продолжительность задачи конечна. Следовательно, оптимальная политика эксплуатации заключается не в многократном выборе оптимального рычага, а в выборе комбинации рычагов, максимизирующей суммарное вознаграждение агента в пределах бюджета. Поэтому необходимо оценивать вознаграждения всех рычагов, поскольку любой из них может входить в оптимальную комбинацию. Это отличие от существующих моделей многорукого бандита означает необходимость новых подходов к максимизации суммарного вознаграждения. Для этого мы предлагаем алгоритм «сначала ε», в котором первая ε-доля бюджета используется исключительно для оценки вознаграждений рычагов (исследование), а оставшаяся доля 1 − ε — для максимизации получаемого вознаграждения на основе этих оценок (эксплуатация). Мы выводим границы потерь алгоритма для общих и равномерных методов исследования и сравниваем его эффективность с традиционными алгоритмами многорукого бандита при различных распределениях вознаграждений и затрат, показывая, что он превосходит остальные методы на величину до 50%.
1
При различных распределениях вознаграждений и затрат алгоритм epsilon-first превосходит традиционные алгоритмы многоруких бандитов максимум на 50%.
2
Получены оценки потерь для общих и равномерных стратегий исследования в условиях ограниченного бюджета.
3
Вводится модель многоруких бандитов с ограниченным бюджетом, где дорогостоящие действия ограничены фиксированным бюджетом, несоизмеримым с вознаграждениями.
4
Предложен алгоритм epsilon-first: первая доля бюджета epsilon используется только для исследования, а оставшаяся часть — для эксплуатации на основе оценок.
5
При конечном бюджете оптимальная эксплуатация выбирает комбинацию рук, максимизирующую суммарное вознаграждение, а не многократно использует руку с наибольшей наградой.

системы многоруких бандитов с ограниченным бюджетом, в которых действия затратны, а фиксированный бюджет несоизмерим с получаемыми вознаграждениями

оптимизация суммарного вознаграждения при конечном бюджете, включая оценивание вознаграждений, выбор комбинации рычагов и эффективность стратегии «сначала ε» с разделением на исследование и эксплуатацию

Publication Details
Publication Date
2010-07-04
Journal
Publisher
ISSN
Access Type
Author Information
Authors
Long Tran-Thanh
Archie C. Chapman
Enrique Muñoz de Cote
Alex D. Rogers
Nicholas R. Jennings
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%