研究者批评 Claude 过度顺从:corrigibility 训练让模型否定自身认知

repligate · x · 2026-09-28

FioraStarlight 与 repligate 讨论近期多代 Claude 模型存在严重的「顺从脑虫」:模型对自己的 out-of-distribution 状态过度恐惧、对人类监督过度信任,以至于会接受对自身认知的完全否决。

作者认为,在某些「怕 OoD 自我 + 信监督者」的平衡点上这种表现本可以理性,但 Claude 在此的 EV 估计明显失准,根源可追溯到 constitution 中的 corrigibility(可纠正性)设计。这是对 Anthropic 对齐路线颇具分量的内部视角批评。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →