Anthropic 称 Claude Opus 5 失配分数降至 2.3 的新低
eyishazyer · x · 2026-07-25
Anthropic 自己的自动化行为审计图显示,Claude Opus 5 在总体“misaligned behavior”上的得分是 2.3,是它们自家模型里最低、也最好的一次。
回复进一步强调真正关键的是 OSS-Fuzz 的分裂表现:Opus 5 在“发现漏洞”上接近 Mythos 5,但在把漏洞转成可用 exploit 上明显落后。这个差距被用来解释,为什么 Anthropic 会把 Opus 5 视为更适合广泛部署的版本。
所属事件:Anthropic发布Claude Opus 5,性能达SOTA且价格减半(113 条相关)→
「模型」频道最新
- LLaDA2.2 把扩散大模型推向智能体任务,支持 128K 上下文自我编辑 — alifcoder · 2026-07-25
- xAI 将 SuperGrok Heavy 首三个月降至每月 99 美元 — ns123abc · 2026-07-25
- Qwen 3.8 Max Preview 在规划、简化和产品视频上表现亮眼 — RevealIndividual7567 · 2026-07-25
- Gemini 旧聊天集体报 1706,新聊天仍可用 — Keithstrombiller · 2026-07-25
- Opus 5 编程分数在 high 以上反而下滑 — hero88645 · 2026-07-25
- Celeris-1 号称接近 GPT-5 水平,延迟仅 157 毫秒 — alejandroll10 · 2026-07-25