Claude Opus 5 多项基准领先,终端编码达 43.3%
Byakko_4 · reddit · 2026-07-25
- 这张图是 Claude Opus 5 的基准测试对比,横向比较了 Fable 5、Opus 4.8 和 GPT-5.6 Sol。
- 图中给出的关键数据包括:agentic terminal coding 43.3%、knowledge work 1861、ARC-AGI-3 30.2%、agentic search 90.8%、computer use 70.6%。
- 结果呈现出混合态势:Opus 5 在多项指标领先,但 GPT-5.6 Sol 在 DeepSWE v1.1 上更高,而 Fable 5 在 Humanity’s Last Exam(无工具) 上略高于 Opus 5。
所属事件:Anthropic 发布 Claude Opus 5,多项基准测试领先(64 条相关)→
「模型」频道最新
- 前端测试里,GPT-5.6 的落地页质感胜过 Claude Opus 5 — Arindam_1729 · 2026-07-25
- Google 因 Gemma 表现和开源立场遭质疑 — BoogerheadCult · 2026-07-25
- 马斯克称 Grok 4.6 两周后、4.7 四周后发布 — elonmusk · 2026-07-25
- Together 称 Kimi K3 以 35% 价格逼近 Claude Fable 5 编码能力 — togethercompute · 2026-07-25
- 马斯克称 Grok 4.5 与 Opus 5 同列帕累托前沿 — elonmusk · 2026-07-25
- ARC-AGI-3 测试发现 Claude Opus 5 展现代数推理新能力 — typewriters · 2026-07-25