Внимание модулирует нормализацию ценности в человеческом обучении с подкреплением, формируя кодирование вознаграждения

Attention modulates value normalization in human reinforcement learning by shaping reward encoding
Romane Cecchi, Sebastian Gluth, Stefano Palminteri
2026-06-21

внимание модулирует нормализацию ценностимодель внимательной нормализации диапазонадлительность взгляданормализация диапазонаобучение с подкреплением
Контекстная оценка — хорошо задокументированное явление в обучении с подкреплением, обычно проявляющееся в виде нормализации диапазона в представлении исходов. Однако недавние результаты показали систематические отклонения от этой модели, особенно при предъявлении трёх вариантов с одинаковыми интервалами значений. В исследовании выдвигается гипотеза, что эти искажения в нормализации исходов возникают из-за процессов внимания. Для проверки мы провели три эксперимента с общим числом участников 105, одновременно отслеживая положение взгляда с помощью трекинга глаз. Кроме того, мы систематически манипулировали вниманием, применяя как установки сверху вниз, так и стимулы снизу вверх. Эти манипуляции существенно увеличивали субъективную оценку посещаемых вариантов, что подтверждает причинную роль внимания в формировании представления ценности. Чтобы объяснить эти эффекты, мы разработали модель обучения с подкреплением, интегрирующую механизмы внимания, в которой длительность взгляда прямо модулирует абсолютную ценность вариантов до применения нормализации диапазона. Эта модель с учётом внимания превосходит альтернативы без внимания и модели повторения выбора, подчёркивая критическое влияние внимания на вычисление ценности. Обучение вознаграждению у людей формируется контекстом, но когнитивные истоки этого смещения остаются слабо изученными. Здесь авторы представляют доказательства того, что внимание может лежать в основе этих искажений, влияя на то, как кодируются вознаграждения в обучении с подкреплением.
1
Внимание вызывает искажения при нормализации диапазона исходов в обучении с подкреплением, объясняя отклонения при трёх равноудалённых вариантах.
2
Манипуляции вниманием (top-down и bottom-up) в трёх экспериментах (N=105) повышают субъективную оценку обращаемых взглядом опций, что указывает на причинную роль внимания в представлении ценности.
3
Длительность взгляда, зафиксированная eye-tracking, напрямую модулирует абсолютную ценность опций перед нормализацией диапазона в предложенной модели обучения с подкреплением.
4
Предложенная модель с учётом внимания (attentional range model) превосходит модели без внимания и модели повторения выбора, подчёркивая критическое влияние внимания на вычисление ценности.

Кодирование ценности вариантов в ходе человеческого обучения с подкреплением (представление вознаграждения с учётом отслеживаемого взглядом внимания)

Влияние внимания (длительности взгляда и манипуляций сверху вниз/снизу вверх) на нормализацию по диапазону и искажения в представлении исходов/ценности и обучении вознаграждению, смоделированное посредством внимательной модели обучения с подкреплением с модуляцией значений

Publication Details
Publication Date
2026-06-21
Journal
Publisher
ISSN
Cited by
0
Access Type
Author Information
Authors
Romane Cecchi
Sebastian Gluth
Stefano Palminteri
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%