Claude Code跑ARC-AGI-3拿下96.2%,几乎零特化代码

khademinori · x · 2026-08-13

开发者 @jeremyberman 使用 Claude Code 配合 Opus 5(高推理模式),在 25 道 ARC-AGI-3 公开测试题中拿下了 96.2% 的高分(仅失败1题),在第二次尝试(pass@2)中更是达到了 99.3% 的近乎满分成绩,总花费约 540 美元。

作为对比,Opus 5 在官方纯模型评估中的得分仅为 30.2%。该方案的核心亮点在于几乎没有任何针对 ARC 谜题的特化代码:整个测试框架(harness)仅包含一个 shell、一个文件系统和一条执行动作的命令,完全没有预置求解器、规划器或网格处理工具。

在运行过程中,模型会在比赛时自行编写并丢弃这些工具代码。在一次完整的测试运行中,模型自动生成了约 269 个程序(包含 12,700 行代码,规模是框架本身的 10 倍),并在游戏结束后将其全部废弃。作者已将测试框架和部分完整会话记录开源。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →