Обеспечение справедливости в задаче стохастического многорукого бандита

Achieving Fairness in the Stochastic Multi-armed Bandit Problem
Vishakha Patil, Ganesh Ghalme, Vineet Nair, Y. Narahari
2019-07-23

UCB1ограничения справедливостиr-регретстохастические многорукие бандитыдопустимая несправедливость
Мы исследуем интересный вариант задачи стохастического многорукого бандита, называемый задачей Fair-SMAB, в котором требуется выбирать каждую ручку не менее заданной доли от общего числа доступных раундов. Мы изучаем взаимосвязь между обучением и справедливостью через заранее заданный вектор, определяющий доли гарантированных выборов каждой ручки. Мы вводим регрет с учетом справедливости, называемый r-регретом, который учитывает указанные ограничения справедливости и естественным образом расширяет традиционное понятие регрета. Наш основной результат заключается в характеристике класса алгоритмов Fair-SMAB двумя параметрами: допустимым уровнем несправедливости и алгоритмом обучения, используемым как алгоритм-черный ящик. Для этого класса мы устанавливаем гарантию справедливости, выполняющуюся равномерно по времени независимо от выбора алгоритма обучения. В частности, если в качестве алгоритма обучения используется UCB1, мы показываем, что предложенный алгоритм достигает r-регрета порядка O(ln T). Наконец, мы оцениваем стоимость справедливости с точки зрения традиционного понятия регрета.
1
Алгоритмы Fair-SMAB характеризуются допуском несправедливости и обучающим алгоритмом, используемым как чёрный ящик; гарантии справедливости выполняются равномерно по времени.
2
В задаче Fair-SMAB каждое плечо должно выбираться не менее заданной доли общего числа раундов.
3
Введён показатель r-Regret, учитывающий ограничения на гарантированное число выборов и обобщающий обычное сожаление.
4
Исследование оценивает стоимость обеспечения справедливости через обычное сожаление.
5
При использовании UCB1 предложенный подход достигает r-Regret порядка O(ln T).

Задача справедливого стохастического многорукого бандита с ограничениями на минимальную долю выборов каждого рычага

Взаимосвязь обучения и справедливости, включая гарантии справедливости, регрет с учётом справедливости r-Regret, алгоритмическую терпимость к несправедливости и стоимость справедливости в терминах обычного регрета

Publication Details
Publication Date
2019-07-23
Journal
Publisher
ISSN
Access Type
Author Information
Authors
Vishakha Patil
Ganesh Ghalme
Vineet Nair
Y. Narahari
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%