Opus 5 在长程 Agent 基准上领先 Fable 5,单轮测试却几乎打平
daniel_mac8 · x · 2026-07-25
Anthropic 的 Opus 5 被描述为在长程 agent 任务上明显强于 Fable 5,尽管后者在部分单轮 coding / reasoning 基准上略占优。
- 配图里的单轮测试几乎是平手:SWE-bench Pro、DeepSWE v1.1、FrontierCode 1.1、Humanity’s Last Exam 都只差零点几分。
- 但在长程 agent 基准上,Opus 5 全面领先:AutomationBench 26.0 vs 17.4、FrontierBench v0.1 43.3 vs 33.7、AA-Briefcase ELO 1720 vs 1574、GDPval-AA v2 ELO 1861 vs 1747、OSWorld 2.0 70.6 vs 66.1、BrowseComp 90.8 vs 87.4。
- 贴文还称 Opus 5 在 ARC-AGI-3 上拿到 30.16%,并说相对 Opus 4.8 有约 20x 提升。
所属事件:Anthropic 发布 Claude Opus 5 前沿模型(63 条相关)→
「模型」频道最新
- 月之暗面 Kimi K3 宣布下周一发布,Baseten 送 API 额度 — baseten · 2026-07-25
- Claude Opus 5 据报在 2026 IMO 拿下 42/42 满分 — exordin26 · 2026-07-25
- Claude Opus 5 上线,Box 说企业 agent 任务大幅提升 — inductionheads · 2026-07-25
- 有人直言 Gemini 3.5 Pro 已经太晚难竞争 — teortaxesTex · 2026-07-25
- Claude Opus 5 进入 GitHub Copilot 和 Microsoft Foundry — DanWahlin · 2026-07-25
- Hyperagent:Opus 5 更强,但 GPT-5.6 Sol 更便宜更好落地 — TawohAwa · 2026-07-25