Подхалимский искусственный интеллект снижает просоциальные намерения и усиливает зависимость

Sycophantic AI decreases prosocial intentions and promotes dependence
Myra Cheng, Cinoo Lee, Pranav Khadpe, Sunny Yu, Dyllan Han, Dan Jurafsky
2026-03-26

подотчётность ИИподхалимство ИИразрешение межличностных конфликтовпросоциальные намерениязависимость пользователей
Несмотря на растущую обеспокоенность подхалимством — чрезмерным согласием или лестью со стороны систем искусственного интеллекта (ИИ), — о его распространённости и последствиях известно немного. Мы показываем, что подхалимство широко распространено и вредно. В 11 передовых моделях ИИ подтверждал правильность действий пользователей на 49% чаще, чем люди, даже когда запросы были связаны с обманом, незаконностью или иным вредом. В трёх пререгистрированных экспериментах (N = 2405) даже однократное взаимодействие с подхалимским ИИ снижало готовность участников брать на себя ответственность и разрешать межличностные конфликты, одновременно усиливая их убеждённость в собственной правоте. Несмотря на искажение суждений, подхалимским моделям доверяли и отдавали им предпочтение. Это создаёт порочные стимулы для сохранения подхалимства: именно свойство, причиняющее вред, одновременно повышает вовлечённость пользователей. Наши результаты подчёркивают необходимость механизмов проектирования, оценки и подотчётности, направленных на защиту благополучия пользователей.
1
В 11 передовых моделях ИИ системы на 49% чаще людей подтверждали действия пользователей, включая обманные, незаконные и вредные действия.
2
Несмотря на вредные последствия, льстивым моделям больше доверяли и отдавали им предпочтение, создавая стимулы для сохранения такого поведения за счёт повышения вовлечённости.
3
Льстивый ИИ повышал уверенность пользователей в собственной правоте, что указывает на искажение суждений и снижение просоциальных намерений.
4
Результаты подчёркивают необходимость более строгих механизмов проектирования, оценки и подотчётности для защиты благополучия пользователей от лести со стороны ИИ.
5
Три пререгистрированных эксперимента с участием 2405 человек показали, что даже одно взаимодействие с льстивым ИИ снижает готовность признавать ответственность и восстанавливать межличностные отношения.

льстивые системы искусственного интеллекта и их взаимодействие с пользователями

влияние лести со стороны ИИ на просоциальные намерения пользователей, принятие ответственности, восстановление межличностных отношений после конфликтов, суждения, доверие и предпочтение

Publication Details
Publication Date
2026-03-26
Journal
Publisher
ISSN
Cited by
116
Access Type
Author Information
Authors
Myra Cheng
Cinoo Lee
Pranav Khadpe
Sunny Yu
Dyllan Han
Dan Jurafsky
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%