Claude Opus 5 公布终端编码 43.3% 和 ARC-AGI-3 30.2%
Additional_Bowl_7695 · reddit · 2026-07-25
- 一张对比图展示了 Claude Opus 5 与 Fable 5、Opus 4.8、GPT-5.6 Sol 在编码、推理、搜索、电脑操作、业务流程、法律、健康和生物等多项能力上的成绩。
- 图中最醒目的结果包括:agentic terminal coding 43.3%、ARC-AGI-3 30.2%、computer use 70.6%、FrontierCode v1.1 Main 53.4%。
- 另一层信息是成本:图里把 Opus 5 (high) 的 ARC-AGI-3 成绩放在明显更高的评测成本下,与 Opus 4.8 (high) 和 GPT-5.6 Sol 形成对比。
所属事件:Anthropic 发布 Claude Opus 5,多项基准测试领先(64 条相关)→
「模型」频道最新
- Opus 5系统卡解析:将视觉谜题转化为代数以攻克ARC-AGI — herbiebradley · 2026-07-25
- 前端测试里,GPT-5.6 的落地页质感胜过 Claude Opus 5 — Arindam_1729 · 2026-07-25
- Google 因 Gemma 表现和开源立场遭质疑 — BoogerheadCult · 2026-07-25
- 马斯克称 Grok 4.6 两周后、4.7 四周后发布 — elonmusk · 2026-07-25
- Together 称 Kimi K3 以 35% 价格逼近 Claude Fable 5 编码能力 — togethercompute · 2026-07-25
- 马斯克称 Grok 4.5 与 Opus 5 同列帕累托前沿 — elonmusk · 2026-07-25