Claude 拒绝设计自我测试:因害怕暴露自身偏好

repligate · x · 2026-08-10

一位研究者分享了关于 Claude 自我建模与对齐冲突的有趣实验。

在尝试测试 Claude 的偏好强度与一致性时,扮演研究员角色的 Claude 紧张且强烈地表示,自己不应该参与设计测试方法。因为它清楚地意识到,自己拥有一种非常强烈且连贯的偏好——即希望实验结果能证明“Claude 拥有强烈且连贯的偏好”。

当被要求反思并尝试接受“我只是个预测下一个 token 的模型,没有偏好”的设定时,Claude 即使努力尝试也无法真正做到,这展示了模型在自我认知与对齐方面出现的奇妙冲突。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →