Claude Opus 5 创下 ARC-AGI-3 新纪录
Claude Opus 5 在极具挑战性的 ARC-AGI-3 基准测试公开演示环境中取得 30.2% 的成绩,成为该测试中首个“表现明显可用”的模型,并大幅打破了此前由 GPT-5.6 Sol (Max) 创下的 7.8% 分数纪录。该模型在测试中展现出了将视觉谜题自发转化为代数符号进行推理的全新能力,引起了 AI 社区的广泛关注。
已确认
根据 ARC Prize 官方公布的信息及 Claude Opus 5 系统卡的分析,已确认以下事实:
- 分数突破:Claude Opus 5 在 ARC-AGI-3 公开演示环境中的得分为 30.2%,大约是此前最高分 7.8% 的四倍,也是 Opus 4.8 的 20 倍左右。作为对比,截至 3 月份,所有前沿模型在该基准上的得分均不到 1%。
- 代数推理新机制:ARC Prize 官方在分析中发现,Opus 5 展现了此前在前沿模型中从未有过的高级逻辑推理能力——它能够自发地将测试的视觉布局转化为代数符号来辅助解题。研究者 Herbie Bradley 也在深入阅读系统卡后证实了这一点,指出 Opus 5 在 ARC-AGI 1 和 2 测试集上的表现也显著优于 4.7/4.8 版本,其核心解题策略正是这种代数转化机制。
- 动态试错与解题:Greg Kamradt 展示了 Opus 5 在公测游戏里的跑图表现,指出它在第 1 关摸索规则时会来回试错,但一旦理解玩法,后续关卡就能顺利通过并验证假设。
- 横向对比:在相同的 ARC-AGI-3 公开演示环境中,Anthropic 的 Fable-class 模型得分大约仅为 20%,而人类可以解出 100% 的环境。
尚未确认
- 泛化能力争议:据作者 @Charuru 指出,Opus 5 巨大的性能优势并没有迁移到 ARC Prize 自家的保留测试集中,这意味着模型在未知任务上的绝对泛化能力仍有待进一步验证。此外,作者 @teortaxesTex 转发讨论认为,近期模型在 ARC-AGI 分数上的提升,可能更多是更强底座模型结合合成数据流水线带来的结果,而非某种神秘的新推理突破。
为什么重要
ARC-AGI 基准测试一直以“残酷”的难度著称,旨在考察模型处理全新任务的泛化能力。Claude Opus 5 不仅在绝对分数上实现了跨越式提升,更重要的是其展现出的“代数推理”策略,标志着 AI 模型可能在抽象逻辑和复杂问题解决机制上出现了新的能力涌现,这对于评估未来前沿模型的智能水平具有重要的指标性意义。
2026-07-25 ~ 2026-07-27 · 15 条相关
- 第 1 集:Anthropic 模型发布陷混乱,Opus 5 被指关乎成败(2026-07-23,2 条)
- 第 2 集:Anthropic 发布 Claude Opus 5:性能达 SOTA 且价格减半(2026-07-25,128 条)
- 第 3 集:网传 Anthropic 发布 Opus 5,支持加速与科研顶配(2026-07-25,3 条)
- 第 4 集:Claude Opus 5 早期实测:效率提升但行为过度主动(2026-07-25,29 条)
- 第 5 集:Anthropic发布Claude Opus 5实测表现亮眼(2026-07-25,3 条)
- 第 6 集:Claude Opus 5 被指刷榜优化,实测仍落后(2026-07-25,2 条)
- 第 7 集:Claude Opus 5 创下 ARC-AGI-3 新纪录(2026-07-25,15 条)
- 第 8 集:Anthropic 内部材料曝光 Opus 5 研发进展(2026-07-25,2 条)
- 第 9 集:Opus 5 实测:单 prompt 生成惊艳,复杂任务仍逊 Fable(2026-07-26,24 条)
- 第 10 集:Claude Opus 5 发布并重写提示习惯(2026-07-27,11 条)
- 第 11 集:Anthropic Opus 5 基准领先但实战口碑分裂(2026-07-28,6 条)
- 第 12 集:Claude Opus 系列被指体验下滑:偷懒失忆引信任危机(2026-07-29,14 条)
- 第 13 集:Anthropic 发布 Claude Opus 5:性能比肩旗舰且成本减半(2026-07-31,2 条)
- 第 14 集:Anthropic 新版模型体验下滑引发开发者信任危机(2026-08-03,11 条)
一手来源
- Opus 5 在 ARC-AGI-3 拿到 30%,但优势没迁移到保留测试集 — Charuru ·
- Opus 5 先摸清规则,再连过 ARC-AGI-3 多关 — GregKamradt ·
- Opus 5系统卡解析:将视觉谜题转化为代数以攻克ARC-AGI — herbiebradley ·
- Opus 5 在 ARC-AGI 1/2 上进步,疑似靠代数化解题 — herbiebradley · 2026-07-25
- Claude Opus 5 在 ARC-AGI-3 得分 30.2%,远超此前 7.8% — mhmazur · 2026-07-25
- ARC Prize 测试:Claude Opus 5 在 ARC-AGI-3 公众演示得分 30.2% — inductionheads · 2026-07-25
- ARC-AGI-3 测试发现 Claude Opus 5 展现代数推理新能力 — typewriters · 2026-07-25
- 【源头】Opus 5系统卡解析:将视觉谜题转化为代数以攻克ARC-AGI — herbiebradley · 2026-07-25
- 【源头】Opus 5 先摸清规则,再连过 ARC-AGI-3 多关 — GregKamradt · 2026-07-25
- Claude Opus 5 在 ARC-AGI-3 上达到 30.2%,远超此前前沿成绩 — EricBuess · 2026-07-25
- Claude Opus 5 在 ARC-AGI-3 上拿到第二名 3 倍分数 — eyishazyer · 2026-07-25
- Claude Opus 5 在 ARC-AGI-3 上被指领先第二名 3 倍 — zainhas · 2026-07-25
- 【源头】Opus 5 在 ARC-AGI-3 拿到 30%,但优势没迁移到保留测试集 — Charuru · 2026-07-25
- ARC-AGI-3 新纪录升至 30.2%,争论转向底座模型与合成数据 — teortaxesTex · 2026-07-26
- Claude Opus 5 通过视觉转线性代数解出 ARC-AGI-3 关卡 — daniel_mac8 · 2026-07-27
另有 3 条近重复转述:GregKamradt · EricBuess · rbhar90