Внимание модулирует нормализацию ценности в человеческом обучении с подкреплением, формируя кодирование вознаграждения
Attention modulates value normalization in human reinforcement learning by shaping reward encoding
2026-06-21
SCID: 54.1/2nff9kqh
Discuss with AI
внимание модулирует нормализацию ценностимодель внимательной нормализации диапазонадлительность взгляданормализация диапазонаобучение с подкреплением
Figures from the paper
Abstract (AI)
Контекстная оценка — хорошо задокументированное явление в обучении с подкреплением, обычно проявляющееся в виде нормализации диапазона в представлении исходов. Однако недавние результаты показали систематические отклонения от этой модели, особенно при предъявлении трёх вариантов с одинаковыми интервалами значений. В исследовании выдвигается гипотеза, что эти искажения в нормализации исходов возникают из-за процессов внимания. Для проверки мы провели три эксперимента с общим числом участников 105, одновременно отслеживая положение взгляда с помощью трекинга глаз. Кроме того, мы систематически манипулировали вниманием, применяя как установки сверху вниз, так и стимулы снизу вверх. Эти манипуляции существенно увеличивали субъективную оценку посещаемых вариантов, что подтверждает причинную роль внимания в формировании представления ценности. Чтобы объяснить эти эффекты, мы разработали модель обучения с подкреплением, интегрирующую механизмы внимания, в которой длительность взгляда прямо модулирует абсолютную ценность вариантов до применения нормализации диапазона. Эта модель с учётом внимания превосходит альтернативы без внимания и модели повторения выбора, подчёркивая критическое влияние внимания на вычисление ценности. Обучение вознаграждению у людей формируется контекстом, но когнитивные истоки этого смещения остаются слабо изученными. Здесь авторы представляют доказательства того, что внимание может лежать в основе этих искажений, влияя на то, как кодируются вознаграждения в обучении с подкреплением.
Key Findings
1
Внимание вызывает искажения при нормализации диапазона исходов в обучении с подкреплением, объясняя отклонения при трёх равноудалённых вариантах.
2
Манипуляции вниманием (top-down и bottom-up) в трёх экспериментах (N=105) повышают субъективную оценку обращаемых взглядом опций, что указывает на причинную роль внимания в представлении ценности.
3
Длительность взгляда, зафиксированная eye-tracking, напрямую модулирует абсолютную ценность опций перед нормализацией диапазона в предложенной модели обучения с подкреплением.
4
Предложенная модель с учётом внимания (attentional range model) превосходит модели без внимания и модели повторения выбора, подчёркивая критическое влияние внимания на вычисление ценности.
Research Object
Кодирование ценности вариантов в ходе человеческого обучения с подкреплением (представление вознаграждения с учётом отслеживаемого взглядом внимания)
Research Subject
Влияние внимания (длительности взгляда и манипуляций сверху вниз/снизу вверх) на нормализацию по диапазону и искажения в представлении исходов/ценности и обучении вознаграждению, смоделированное посредством внимательной модели обучения с подкреплением с модуляцией значений
Publication Details
Publication Date
2026-06-21
Journal
Publisher
ISSN
Cited by
0
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest