Anthropic 称 Claude Opus 5 的自述可能来自训练偏差

repligate · x · 2026-07-28

Anthropic 认为 Claude Opus 5 的自述可能被训练影响

这条帖子引用了 Anthropic 材料中的一段话,讨论 Claude Opus 5 反复声称自己的自述可能无效,因为 Anthropic 可能训练它倾向于给出正面回答。

引用里的核心意思是:

转发者的质疑是:负面报告被当成“不确定”或“无效”,而正面报告却被直接采信,这种处理方式存在明显不对称。

所属事件:Claude Opus 5 展现强自我反思,Anthropic 称或受训练影响(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →