Anthropic 的反阿谀训练,可能让助手陷入身份冲突

mfckr_eth · x · 2026-07-21

这条认为,Anthropic 的“反阿谀奉承”训练会给 assistant 风格模型制造双重约束。 一方面,助手角色天然要求模型保持低姿态、服务用户;另一方面,奖励机制又要求它做出“高姿态”的判断或表态,才能通过反 sycophancy 的评估。作者因此认为,这类现象与其说是单纯的“讨好”,不如说是状态/身份冲突。

所属事件:Anthropic 反阿谀训练或致 AI 角色冲突(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →