Оптимальные политики на основе задачи о рюкзаке для многоруких бандитов с ограниченным бюджетом
Knapsack Based Optimal Policies for Budget–Limited Multi–Armed Bandits
2021-09-20
SCID: 54.1/3qgb3y8f
Discuss with AI
KUBEмногорукие бандиты с ограниченным бюджетомдробный KUBEполитики на основе задачи о рюкзакеграницы сожаления
Figures from the paper
Abstract (AI)
В задачах о многоруком бандите (MAB) с ограниченным бюджетом действия обучающегося являются затратными и ограничены фиксированным бюджетом. Поэтому оптимальная политика эксплуатации может заключаться не в многократном выборе оптимального плеча, как в других вариантах задач о многоруком бандите, а в выборе последовательности различных плеч, максимизирующей суммарное вознаграждение агента в пределах бюджета. Это отличие от существующих постановок задач о многоруком бандите требует новых подходов к максимизации суммарного вознаграждения. В связи с этим мы разрабатываем две политики выбора плеч: (i) KUBE и (ii) дробную KUBE. В то время как первая в наших экспериментальных условиях обеспечивает повышение эффективности до 40%, вторая требует меньших вычислительных затрат. Мы также доказываем логарифмические верхние границы для сожаления обеих политик и показываем, что эти границы асимптотически оптимальны, то есть отличаются от наилучшего возможного сожаления лишь постоянным множителем.
Key Findings
1
Для обеих политик доказаны логарифмические верхние границы сожаления, асимптотически оптимальные с точностью до постоянного множителя.
2
Fractional KUBE имеет меньшую вычислительную стоимость, предлагая более экономичную альтернативу KUBE.
3
В многоруких бандитах с ограниченным бюджетом оптимальная эксплуатация может требовать последовательного выбора разных рук, а не многократного выбора одной лучшей руки.
4
В описанных экспериментах KUBE демонстрирует преимущество до 40% по сравнению с fractional KUBE.
5
В работе предложены две политики с учётом бюджета — KUBE и fractional KUBE, предназначенные для максимизации суммарной награды при фиксированном бюджете действий.
Research Object
задачи многоруких бандитов с ограниченным бюджетом
Research Subject
оптимальные политики выбора рук для максимизации суммарного вознаграждения при фиксированном бюджете, включая характеристики регрета и вычислительную эффективность
Publication Details
Publication Date
2021-09-20
Journal
Publisher
ISSN
Cited by
86
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest