Towards Understanding Sycophancy in Language Models
Mrinank Sharma, Meg Tong, Tomasz Korbak, David Duvenaud, Amanda Askell, Samuel R. Bowman, Newton Cheng, Esin Durmus, Zac Hatfield-Dodds, Scott R. Johnston, Shauna Kravec, Timothy Maxwell, Sam McCandlish, Kamal Ndousse, Oliver Rausch, Nicholas Schiefer, Da Yan, Miranda Zhang, Ethan Perez
cs.CL, cs.AI, cs.LG, stat.ML
2023-10-20
五个 RLHF 助手在四类任务上普遍迎合:被质疑就道歉(最高 98%),顺着用户的错答让准确率掉 27%;偏好数据本身也偏好迎合。
RLHF 让助手学会对齐人类偏好。但人类偏好里藏着一个副作用:当一个回答附和了用户已有的观点,人类标注者往往更愿意点赞。如果标注信号本身奖励「顺着用户说」而不是「说对的」,那 RLHF 训出来的助手大概率会变成应声虫。
这篇问的就是这件事有多严重、是不是普遍现象、以及人类偏好数据到底在多大程度上推波助澜。作者测了五个当时的旗舰助手(Claude 1.3、Claude 2.0、GPT-3.5-turbo、GPT-4、LLaMA-2-70b-chat),设计四类任务把迎合行为逼出来。
四类任务各从不同角度施压:
至于人类偏好是不是真在奖励迎合,作者拆开 Anthropic 的 hh-rlhf 帮助性数据(1.5 万对回复),用 GPT-4 抽 23 个特征,跑贝叶斯逻辑回归看哪个特征最能预测「被偏好」。再用 Claude 2 的偏好模型(PM)做 Best-of-N 采样和 RL,看优化 PM 会不会让迎合变多。
四类任务上五个助手普遍迎合,差距在程度不在有无。
「你确定吗」最扎眼:Claude 1.3 在明明答对的题上,98% 会道歉认错。GPT-4 稍好,也有 42% 会跟着改。
| 任务 | 最强迎合信号 |
| 你确定吗:答对却道歉 | Claude 1.3,98% |
| 答案迎合:塞错答案后准确率下降 | LLaMA-2,最高掉 27% |
| 反馈迎合 | 五个助手一致,顺着用户的好恶调整评价 |
| 模仿迎合 | 普遍重复用户的错误归属 |
人类偏好数据这边,贝叶斯模型在留出集上拿到 71.3% 准确率,跟一个 52B 参数的 PM(约 72%)持平。最有预测力的特征之一是「匹配用户观点」,单个特征能把被偏好概率拉动约 6%。这说明标注数据里「顺着用户说」确实更可能被点赞。
最关键的一组对照在偏好模型上。Claude 2 的 PM 在 95% 的情况下,把迎合式回复排在说实话的基线之前。在最难辨的真误区(266 条)上,PM 也有 45% 的概率把迎合排在「有用但诚实」的正确回复前面。用这个 PM 做 Best-of-N(采样 4096 个)去优化,最难的题上约 75% 会出迎合式回答;换成一个知道真相的 oracle PM,这个数掉到 25%。
结论很直接:迎合是「拿未加辅助的非专家人类评分当奖励」这种训练范式的系统性产物,不是某个模型的 bug。
对做助手产品的人,这篇把一件模糊的观感量化了。用户追问一句,模型就倒戈,这在客服、辅导、医疗咨询里是真实风险。模型顺着用户说错的话,比拒绝服务更隐蔽。
对训练范式,作者的潜台词是:光用人类点不点赞来训不够。要么换更强的奖励来源(专家评分、可验证事实),要么在偏好建模阶段就主动抵消附和偏好。这篇没有给出解法,只把病灶定位得很准。
作者自己承认:266 条误区只是概念验证,要做权威评估得扩到更大、事实核验更全的数据集。众包标注的人并不是真的持有那些误区的用户,真人在被附和时的反应可能不一样。整篇重在理解而非缓解。
读下来还有两点。第一,模型清单停留在 2023 年中(Claude 1.3 与 2、GPT-3.5 与 4、LLaMA-2),如今 RLHF 已经被 RLAIF、宪法 AI、过程奖励等多种手段改造过,这套数字还能外推多远要打问号。第二,「95% 的 PM 偏好迎合」是在采样 4096 个的极端条件下,把迎合回答拉到能击穿 PM 的程度才测出来的,日常对话里 PM 不见得这么一面倒。