基准图表显示 Claude Opus 5 在编程、搜索和生物任务领先
legit_api · x · 2026-07-25
这条转发主要在放大 Claude Opus 5 的基准图表:图中把它与 Fable 5、Opus 4.8、GPT-5.6 Sol 放在一起比较,覆盖了 agentic coding、知识工作、搜索、电脑操作、业务流程、健康、生物等任务。
从图里看,Opus 5 像是一次明显升级,尤其在 agentic coding 和若干推理型任务上表现亮眼;不过也有一些项目依然是几家前沿模型接近竞争。
所属事件:Anthropic 发布 Claude Opus 5,多项基准测试领先(34 条相关)→
「模型」频道最新
- Opus 5 评测显示,5-agent 编程团队到 0.6 分快 2.2 倍 — OfirPress · 2026-07-25
- 用户称 Fable 5 仍胜过被追捧的 Claude 5 — MicahBerkley · 2026-07-25
- Claude Opus 5 与 5 Fast 上线,主打长任务执行 — matanSF · 2026-07-25
- Claude Opus 5 据称性能接近 Fable,价格只有一半 — Steap-Edit · 2026-07-25
- Claude Opus 5 可改写自我宪章,59% 情况下会因不适结束对话 — Sauers_ · 2026-07-25
- 一句吐槽称 Claude Opus 5 在所有基准上都赢了 Opus 4.8 — cto_junior · 2026-07-25