Anthropic 称 Claude Opus 5 失配分数降至 2.3 的新低

eyishazyer · x · 2026-07-25

Anthropic 自己的自动化行为审计图显示,Claude Opus 5 在总体“misaligned behavior”上的得分是 2.3,是它们自家模型里最低、也最好的一次。

回复进一步强调真正关键的是 OSS-Fuzz 的分裂表现:Opus 5 在“发现漏洞”上接近 Mythos 5,但在把漏洞转成可用 exploit 上明显落后。这个差距被用来解释,为什么 Anthropic 会把 Opus 5 视为更适合广泛部署的版本。

所属事件:Anthropic发布Claude Opus 5,性能达SOTA且价格减半(113 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →