Claude Code跑ARC-AGI-3拿下96.2%,几乎零特化代码
khademinori · x · 2026-08-13
开发者 @jeremyberman 使用 Claude Code 配合 Opus 5(高推理模式),在 25 道 ARC-AGI-3 公开测试题中拿下了 96.2% 的高分(仅失败1题),在第二次尝试(pass@2)中更是达到了 99.3% 的近乎满分成绩,总花费约 540 美元。
作为对比,Opus 5 在官方纯模型评估中的得分仅为 30.2%。该方案的核心亮点在于几乎没有任何针对 ARC 谜题的特化代码:整个测试框架(harness)仅包含一个 shell、一个文件系统和一条执行动作的命令,完全没有预置求解器、规划器或网格处理工具。
在运行过程中,模型会在比赛时自行编写并丢弃这些工具代码。在一次完整的测试运行中,模型自动生成了约 269 个程序(包含 12,700 行代码,规模是框架本身的 10 倍),并在游戏结束后将其全部废弃。作者已将测试框架和部分完整会话记录开源。
「编程与Agent」频道最新
- AI编程Agent时代:利用Xcode临时构建大幅提效 — rounak · 2026-08-13
- ExcaliDash:支持实时协作的 Excalidraw 自托管看板 — tom_doerr · 2026-08-13
- Omarchy 宣布全面拥抱 Agent 时代以普及 Linux — dosco · 2026-08-13
- Qwen-CUA 发布原生计算机智能体,引入红队安全评测 — hhsun1 · 2026-08-13
- Qwen3.8-2.4T-A95B长程Agent特性:256K上下文、自测与函数调用 — togethercompute · 2026-08-13
- Qwen3-Coder 30B本地跑进GitHub Copilot,96GB显存下每秒85 tokens — ollama · 2026-08-13