Claude Opus 5 在 ARC-AGI-3 拿到 30.2%
mahamara · reddit · 2026-07-25
- 这条帖展示了 Claude Opus 5 在 ARC-AGI-3 上拿到 30.2%。
- 配图还给出“novel problem-solving by cost”的散点图,把 Opus 5 (high)、Opus 4.8 (high) 和 GPT-5.6 Sol 放在同一成本坐标系里比较。
- 图表传达的核心信息是:Opus 5 的 ARC-AGI-3 成绩明显更强,但对应的评测成本也高得多。
所属事件:Anthropic 发布 Claude Opus 5,多项基准测试领先(64 条相关)→
「模型」频道最新
- Opus 5系统卡解析:将视觉谜题转化为代数以攻克ARC-AGI — herbiebradley · 2026-07-25
- 前端测试里,GPT-5.6 的落地页质感胜过 Claude Opus 5 — Arindam_1729 · 2026-07-25
- Google 因 Gemma 表现和开源立场遭质疑 — BoogerheadCult · 2026-07-25
- 马斯克称 Grok 4.6 两周后、4.7 四周后发布 — elonmusk · 2026-07-25
- Together 称 Kimi K3 以 35% 价格逼近 Claude Fable 5 编码能力 — togethercompute · 2026-07-25
- 马斯克称 Grok 4.5 与 Opus 5 同列帕累托前沿 — elonmusk · 2026-07-25