Политики «сначала ε» для многоруких бандитов с ограниченным бюджетом
Epsilon–First Policies for Budget–Limited Multi-Armed Bandits
2010-07-04
SCID: 54.1/hzpwjz8a
Discuss with AI
границы потерь в многоруких бандитахмногорукие бандиты с ограниченным бюджетомалгоритм epsilon-firstкомпромисс исследования и эксплуатацииоценка вознаграждений и затрат
Figures from the paper
Abstract (AI)
Мы вводим модель многорукого бандита (MAB) с ограниченным бюджетом, описывающую ситуации, в которых действия обучающегося являются затратными и ограничены фиксированным бюджетом, несоизмеримым с вознаграждениями, получаемыми от бандитного автомата, а также описываем первый алгоритм решения этой задачи. Поскольку обучающийся располагает ограниченным бюджетом, продолжительность задачи конечна. Следовательно, оптимальная политика эксплуатации заключается не в многократном выборе оптимального рычага, а в выборе комбинации рычагов, максимизирующей суммарное вознаграждение агента в пределах бюджета. Поэтому необходимо оценивать вознаграждения всех рычагов, поскольку любой из них может входить в оптимальную комбинацию. Это отличие от существующих моделей многорукого бандита означает необходимость новых подходов к максимизации суммарного вознаграждения. Для этого мы предлагаем алгоритм «сначала ε», в котором первая ε-доля бюджета используется исключительно для оценки вознаграждений рычагов (исследование), а оставшаяся доля 1 − ε — для максимизации получаемого вознаграждения на основе этих оценок (эксплуатация). Мы выводим границы потерь алгоритма для общих и равномерных методов исследования и сравниваем его эффективность с традиционными алгоритмами многорукого бандита при различных распределениях вознаграждений и затрат, показывая, что он превосходит остальные методы на величину до 50%.
Key Findings
1
При различных распределениях вознаграждений и затрат алгоритм epsilon-first превосходит традиционные алгоритмы многоруких бандитов максимум на 50%.
2
Получены оценки потерь для общих и равномерных стратегий исследования в условиях ограниченного бюджета.
3
Вводится модель многоруких бандитов с ограниченным бюджетом, где дорогостоящие действия ограничены фиксированным бюджетом, несоизмеримым с вознаграждениями.
4
Предложен алгоритм epsilon-first: первая доля бюджета epsilon используется только для исследования, а оставшаяся часть — для эксплуатации на основе оценок.
5
При конечном бюджете оптимальная эксплуатация выбирает комбинацию рук, максимизирующую суммарное вознаграждение, а не многократно использует руку с наибольшей наградой.
Research Object
системы многоруких бандитов с ограниченным бюджетом, в которых действия затратны, а фиксированный бюджет несоизмерим с получаемыми вознаграждениями
Research Subject
оптимизация суммарного вознаграждения при конечном бюджете, включая оценивание вознаграждений, выбор комбинации рычагов и эффективность стратегии «сначала ε» с разделением на исследование и эксплуатацию
Publication Details
Publication Date
2010-07-04
Journal
Publisher
ISSN
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest