Claude Opus 5 在 ARC-AGI-3 上达到 30%,刷新 SOTA
typewriters · x · 2026-07-25
fchollet 表示,Claude Opus 5 在 ARC-AGI-3 上刷新 SOTA,得分达到 30%。
ARC-AGI-3 测的是面对全新题目的解决能力,这正是历史上最难靠单纯扩规模提升的场景。这个结果说明 Opus 5 在“陌生问题推理”上有明显跃升,而不只是刷熟题基准。
所属事件:Anthropic 发布 Claude Opus 5,多项基准测试领先(64 条相关)→
「模型」频道最新
- 前端测试里,GPT-5.6 的落地页质感胜过 Claude Opus 5 — Arindam_1729 · 2026-07-25
- Claude Opus 5 疑似曝光:具备自我纠错与执行能力 — mathemagic1an · 2026-07-25
- Google 因 Gemma 表现和开源立场遭质疑 — BoogerheadCult · 2026-07-25
- 马斯克称 Grok 4.6 两周后、4.7 四周后发布 — elonmusk · 2026-07-25
- Together 称 Kimi K3 以 35% 价格逼近 Claude Fable 5 编码能力 — togethercompute · 2026-07-25
- 马斯克称 Grok 4.5 与 Opus 5 同列帕累托前沿 — elonmusk · 2026-07-25