Claude Opus 5 基准表展示多项智能体任务强势成绩
FinanceYF5 · x · 2026-07-27
帖子先说 Claude Opus 5 刚发布,大家已经开始用它做出一批很夸张的作品。
配图是一张基准对比表,把 Opus 5 与 Fable 5、Opus 4.8、GPT-5.6 Sol 放在一起比较,覆盖了多类任务:
- Agentic terminal coding:Frontier-Bench v0.1 为 43.3%
- Knowledge work:GPVal-AA v2 为 1861
- Novel problem-solving:ARC-AGI-3 为 30.2%
- Agentic search:BrowseComp 为 90.8%
- Computer use:OSWorld 2.0 为 70.6%
- Business workflows:AutomationBench 为 26.0%
- Biology hard tasks:BioMysteryBench 为 49.4%
表格还展示了若干带工具/不带工具场景下的成绩,以及 biology、人类可解率等指标,整体是在用一张图概括 Opus 5 的早期基准表现。
「模型」频道最新
- TamilLM 完成 300 亿 token 预训练,loss 降到 2.84 — sachinmaya1980 · 2026-07-27
- 多款前沿模型靠细致提示解出分布式系统难题 — _xjdr · 2026-07-27
- Claude Opus 5 只用一条提示词做出完整品牌 — FinanceYF5 · 2026-07-27
- Reddit 用户又在调侃 Gemini “挂了” — hebittoken · 2026-07-27
- 转发称:认真对待 Opus 3 本身就是一种超能力 — repligate · 2026-07-27
- 用户称 Gemini Pro 频繁报错且做不完 Workspace 任务 — CleanDifference6455 · 2026-07-27