Anthropic 发布 Claude Opus 5,基准表现明显超过 Opus 4.8
dr_cintas · x · 2026-07-25
Anthropic 发布了 Claude Opus 5,并用一组基准图强调它相对 Opus 4.8 的明显提升,同时与 Fable 5、GPT-5.6 Sol 做了对比。
配图给出的关键结果包括:
- Agentic terminal coding:Frontier-Bench v0.1 上 43.3%
- Knowledge work:GDPval-AA v2 上 1861
- Novel problem-solving:ARC-AGI-3 上 30.2%
- Agentic search:BrowseComp 上 90.8%
- Computer use:OSWorld 2.0 上 70.6%
- Agentic coding:DeepSWE v1.1 上 68.8%,FrontierCode v1.1 上 53.4%
- Business workflows:AutomationBench 上 26.0%
- Health:HealthBench Professional 上 59.8%
- Biology:BioMysteryBench 上 hard 49.4%、human solved 90.1%
第二张图则在 ARC-AGI-3 的“成本-效果”坐标里展示,Opus 5 的新问题解决能力明显高于图中的低成本基线点。
所属事件:Anthropic 发布 Claude Opus 5,多项基准领先且价格减半(73 条相关)→
「模型」频道最新
- LLaDA2.2 把多轮 Agent 真正瓶颈指向解码速度 — Direct_Band896 · 2026-07-25
- Opus 5 刻意避开 cyber 训练,却仍接近 Mythos 5 的找洞能力 — cedric_chee · 2026-07-25
- GPT-5.6 Sol 用力量流通关 Slay the Spire 进阶 6 — Jsevillamol · 2026-07-25
- Anthropic 称 Opus 5 是其迄今最对齐的模型 — Polymarket · 2026-07-25
- Claude Opus 5 综合登顶,Fable 5 仍领跑编程代理 — Hesamation · 2026-07-25
- Anthropic Opus 5 会在 59% 情况下写入结束对话理由 — Miles_Brundage · 2026-07-25