Schema harness 引爆 ARC-AGI-3 讨论
7 月 16 日至 18 日,多条帖子集中讨论名为 Schema 的 agent harness。按 naval、TFenrir、wearemammals 与机器之心的转述,这套方案不改模型权重,而是重写模型外层的观察、假说、实验、修正与执行流程;它之所以迅速出圈,是因为帖子里反复出现了 ARC-AGI-3 Public set 接近满分的成绩说法,也由此带动了“ARC-AGI-3 的关键变量是否已转向 harness 设计”的讨论。
关键结果
本簇里被重复最多的数字是 ARC-AGI-3 Public set 的 99%。TFenrir称,Schema 搭配 Fable+4.8 可达 99%,搭配 GPT 5.6 Sol 为 95.35%;而 xiuyul、WalterReade 等人的转述里,高分配置又写成 Opus 4.8 + Fable 5 达到 99%,说明不同帖子对具体模型组合的说法并不完全一致。另一个相关基准来自 Greg Kamradt:他推荐的一组社区成绩是在 25 个公开游戏中拿到 78.4%,完成 160/183 个关卡,并称当前最佳前沿 LLM 的单次会话得分只有 4.5%;就现有材料看,这更像是用于衬托外层系统设计的重要性。
方法思路
多条帖子对 Schema 的核心理解比较一致。wearemammals概括为:不训练底座模型,而是改观察建模、历史验证、计划执行与修订流程。naval转述称,这个 harness 试图让 agent 以“像物理学家一样推理”的方式去玩游戏、写代码。Gary Marcus转发时提到,一种关键思路是先把经验转成程序化世界模型,再用完整历史做验证。xiuyul的几条转述进一步强调,latent world representation 在这里被做成“程序”而非向量,并把 analysis-by-synthesis、representation finding 直接编码进 harness。Greg Kamradt转述的经验则是:面对新任务时,先用动作摸清规则与约束,而不是立刻冲目标。
争议与存疑
现有帖子大多在重复高分结果,但完整评测设置、复现实验细节和误差边界并未展开;不同转述对最高分所对应的模型版本也存在出入。仅据这些帖子,当前更稳妥的结论不是 ARC-AGI-3 已被彻底解决,而是围绕它的研究重心正在明显转向自定义 harness、全历史验证、表示发现与行动效率等外层系统设计。
2026-07-16 ~ 2026-07-18 · 14 条相关
一手来源
- Schema harness 宣称刷高 ARC-AGI-3 — TFenrir ·
- Schema harness 声称 ARC-3 高分 — we_are_mammals ·
- ARC-AGI-3 社区分数大幅领先 — GregKamradt ·
- 【源头】ARC-AGI-3 社区分数大幅领先 — GregKamradt · 2026-07-16
- Agent harness 刷 ARC-AGI-3 — naval · 2026-07-16
- ARC-AGI-3 上的高分 harness 结果 — WalterReade · 2026-07-17
- ARC-AGI-3 有新结果 — xiuyu_l · 2026-07-17
- ARC-AGI-3上出现高分结果 — xiuyu_l · 2026-07-17
- schema 在 ARC-AGI-3 上取得高分 — xiuyu_l · 2026-07-17
- ARC-AGI-3上新方法出分 — bryanlanders · 2026-07-17
- 【源头】Schema harness 宣称刷高 ARC-AGI-3 — TFenrir · 2026-07-17
- 【源头】Schema harness 声称 ARC-3 高分 — we_are_mammals · 2026-07-17
- ARC-AGI-3或可被框架化求解 — GaryMarcus · 2026-07-17
- 程序综合与ARC-AGI-3新方案 — xiuyu_l · 2026-07-17
- 自定义 Harness 才是 Agent 杠杆 — omarsar0 · 2026-07-17
- ARC-AGI-3新思路:先摸规则 — GregKamradt · 2026-07-18
- Schema 把 ARC-AGI-3 打到接近满分 — 机器之心 · 2026-07-18