Оптимальные политики на основе задачи о рюкзаке для многоруких бандитов с ограниченным бюджетом

Knapsack Based Optimal Policies for Budget–Limited Multi–Armed Bandits
Long Tran-Thanh, Archie C. Chapman, Alex Rogers, Nicholas R. Jennings
2021-09-20

KUBEмногорукие бандиты с ограниченным бюджетомдробный KUBEполитики на основе задачи о рюкзакеграницы сожаления
В задачах о многоруком бандите (MAB) с ограниченным бюджетом действия обучающегося являются затратными и ограничены фиксированным бюджетом. Поэтому оптимальная политика эксплуатации может заключаться не в многократном выборе оптимального плеча, как в других вариантах задач о многоруком бандите, а в выборе последовательности различных плеч, максимизирующей суммарное вознаграждение агента в пределах бюджета. Это отличие от существующих постановок задач о многоруком бандите требует новых подходов к максимизации суммарного вознаграждения. В связи с этим мы разрабатываем две политики выбора плеч: (i) KUBE и (ii) дробную KUBE. В то время как первая в наших экспериментальных условиях обеспечивает повышение эффективности до 40%, вторая требует меньших вычислительных затрат. Мы также доказываем логарифмические верхние границы для сожаления обеих политик и показываем, что эти границы асимптотически оптимальны, то есть отличаются от наилучшего возможного сожаления лишь постоянным множителем.
1
Для обеих политик доказаны логарифмические верхние границы сожаления, асимптотически оптимальные с точностью до постоянного множителя.
2
Fractional KUBE имеет меньшую вычислительную стоимость, предлагая более экономичную альтернативу KUBE.
3
В многоруких бандитах с ограниченным бюджетом оптимальная эксплуатация может требовать последовательного выбора разных рук, а не многократного выбора одной лучшей руки.
4
В описанных экспериментах KUBE демонстрирует преимущество до 40% по сравнению с fractional KUBE.
5
В работе предложены две политики с учётом бюджета — KUBE и fractional KUBE, предназначенные для максимизации суммарной награды при фиксированном бюджете действий.

задачи многоруких бандитов с ограниченным бюджетом

оптимальные политики выбора рук для максимизации суммарного вознаграждения при фиксированном бюджете, включая характеристики регрета и вычислительную эффективность

Publication Details
Publication Date
2021-09-20
Journal
Publisher
ISSN
Cited by
86
Access Type
Author Information
Authors
Long Tran-Thanh
Archie C. Chapman
Alex Rogers
Nicholas R. Jennings
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%