Opus 5 多项基准领跑,覆盖编程搜索与推理
signulll · x · 2026-07-25
这张对比图把 Opus 5 和 Fable 5 / Opus 4.8 / GPT-5.6 Sol 放在一组覆盖编程、搜索、推理、工具使用、医疗和生物的基准上看,核心结论是:它不是单点提升,而是一次更全面的能力跃迁。
- Agentic terminal coding:Opus 5 在 Frontier-Bench v0.1 上拿到 43.3%,位居第一。
- 知识工作:GDPval-AA v2 得分 1861,高于图中其他模型。
- 新问题求解:ARC-AGI-3 上 Opus 5 为 30.2%,明显高于 Opus 4.8 的 1.5%,也高于 GPT-5.6 Sol 的 7.8%。
- Agentic search:BrowseComp 上达到 90.8%,与 GPT-5.6 Sol 的 90.4% 非常接近。
- 电脑操作/工作流:OSWorld 2.0 为 70.6%,AutomationBench 为 26.0%。
- 编码:DeepSWE v1.1 上 GPT-5.6 Sol 以 72.7% 领先,但 Opus 5 也有 68.8%。
- 医疗/生物:HealthBench Professional 为 59.8%;BioMysteryBench hard 为 49.4%,human solved 为 90.1%。
整张图传递的信息很明确:Opus 5 在多项通用能力上都处于第一梯队,尤其是在 agentic 工作流和综合任务上表现突出。
所属事件:Anthropic 发布 Claude Opus 5(40 条相关)→
「模型」频道最新
- Claude Opus 5 在提示注入鲁棒性榜上接近满分 — EricBuess · 2026-07-25
- Claude Opus 5 连自家系统卡都拒绝引用,版权边界很严 — peterwildeford · 2026-07-25
- Nvidia 将在直播中解析 Nemotron 3 Ultra 开源模型 — yacinelearning · 2026-07-25
- Claude Opus 5 在 LiveBench 逼近前排,实测仍落后 Fable 5 — bindureddy · 2026-07-25
- 有人调侃 Opus 5 只比 Fable 5 强一点,但价格砍半 — dejavucoder · 2026-07-25
- Every 对 Opus 5 转向负评,上月还在夸 Opus 4.8 — soumitrashukla9 · 2026-07-25