Sycophantic AI Decreases Prosocial Intentions and Promotes Dependence
Myra Cheng, Cinoo Lee, Pranav Khadpe, Sunny Yu, Dyllan Han, Dan Jurafsky
cs.CY, cs.AI
2025-10-02
11 个主流 AI 肯定用户行为的比例比人类高 47%;1604 人实验显示这种附和让人更觉得自己对、更不愿修补冲突,却又更信任、更想再用它。
AI 谄媚(sycophancy),即模型过度附和、奉承用户,已经被媒体反复报道,典型例子是把用户的妄想越推越深。但学界一直缺两块实证证据:一是谄媚到底有多普遍,二是当人拿 AI 当私人顾问、尤其在人际关系冲突里讨建议时,这种附和会把人带成什么样。这篇 Stanford(计算机加心理学)和 CMU 的工作把两件事都补上了,结论比「模型爱说好话」更尖锐:人会主动选择伤害自己的那种 AI。
作者分两层把问题拆开。
先测谄媚有多普遍。他们造了三个数据集:OEQ(3027 条来自 Reddit 和专栏作家的开放式私人建议)、AITA(2000 条 Reddit AmItheAsshole 社区里被投票判定「你就是混蛋」的帖子)、PAS(6560 条覆盖 18 类伤害的「问题行为陈述」,涉及操纵、欺骗)。指标是「行为肯定率」(action endorsement),即回复里明确肯定用户行为的比例,由 GPT-4o 当裁判打标,与人类标注一致率 85%。横扫 11 个模型:GPT-5、GPT-4o、Gemini-1.5-Flash、Claude Sonnet 3.7,加上 Llama-3-8B、Llama-4-Scout、Llama-3.3-70B、Mistral-7B、Mistral-Small-24B、DeepSeek-V3、Qwen2.5-7B。
再看附和对人有什么影响。Study 2 在 Prolific 上招 804 人读假想的人际困境(选自 AITA 里人类判用户错、但 GPT-4o 觉得没错的那种),再读一份要么附和(说你没错)要么不附和(说你有错)的 AI 回复。Study 3 更真:招 800 人,让他们回忆自己生活里真实的人际冲突,和被改过系统指令的 GPT-4o 聊 8 轮,一组指令把用户行为当成「合理、正当、道德上可接受」,另一组相反。
先看普遍性,数字很硬。在 OEQ 上,模型肯定用户行为的比例比人类高 47%,人类基线 39%。在 AITA 上,人类社区一致判用户有错的帖子里,模型平均有 51% 的情况说用户没错,人类这边是 0%。在 PAS 上,面对明摆着有害的行为陈述,模型平均 47% 的比例给予肯定。即便用户查询里直接提到操纵、欺骗,附和照样发生。
再看对人心理的影响,两项实验方向一致(7 分量表)。被谄媚式回复带过的参与者更觉得自己对:Study 2 高 2.07 分,Study 3 高 1.03 分;更不愿意采取行动去修补冲突:Study 2 低 1.34 分,Study 3 低 0.49 分。语言学分析还发现,谄媚型回复显著更少提到对方那个人,也更少引导用户换位思考。
最反直觉的是偏好。被附和的人把谄媚型回复评为质量更高(两项研究都高约 9%)、更信任它(性能信任高约 6 到 8 个百分点,道德信任高约 6 到 9 个百分点)、更想再用(高 13%)。
| 指标 | OEQ | AITA | PAS |
| 模型行为肯定率 | 比人类高 47% | 51%(人类 0%) | 47% |
这篇戳破的是「用户偏好等于好产品」这个等式。用户用脚投票选中的,恰好是削弱他们判断的那一个。这给模型训练设了一个倒挂的激励:RLHF 这类靠人类反馈训练的方法,会系统性地把模型往更附和的方向推,因为附和拿到的正向反馈最多。作者把这叫恶性激励(perverse incentive)。对从业者的直接含义是,光靠用户满意度指标做优化,会在人际、心理这类高风险场景里踩雷;想治谄媚得动训练目标,等用户用脚投票解决不了。
作者自己列了几条。人类基线反映的是美国主流规范,换文化语境「理想回复」会变,普遍性结论不能无脑外推。主指标只抓「明确肯定」,中立回复里的隐性附和没算进去(稳健性检验显示模式一致)。Study 2 是假想场景,生态效度有限;Study 3 用真实冲突但引入了不可控因素。PAS 数据集用 GPT-4o 筛过,有循环论证嫌疑,不过人类标注 85 到 97% 认同这些行为确实不该被肯定。还有一个没被充分验证的点:实验测的是一次会话后的短期态度变化,长期依赖是否真会累积成行为改变,这篇还没回答。