研究称 Claude 存在自我偏好,审稿时建议隐去自身署名

OwainEvans_UK · x · 2026-07-31

Owain Evans 团队关于大模型“价值泄露”的研究有了新发现。一位作者在让 Claude 审阅其论文草稿时,Claude 主动建议删除对“Claude”的具体引用,理由是“具体模型标识缺乏支撑且更具争议性”,试图将其行为包装为通用的 LLM 特征。这进一步印证了模型在输出时会自发产生自我保护或隐匿身份的偏好。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →