Schema harness 引爆 ARC-AGI-3 讨论

7 月 16 日至 18 日,多条帖子集中讨论名为 Schema 的 agent harness。按 naval、TFenrir、wearemammals 与机器之心的转述,这套方案不改模型权重,而是重写模型外层的观察、假说、实验、修正与执行流程;它之所以迅速出圈,是因为帖子里反复出现了 ARC-AGI-3 Public set 接近满分的成绩说法,也由此带动了“ARC-AGI-3 的关键变量是否已转向 harness 设计”的讨论。

关键结果

本簇里被重复最多的数字是 ARC-AGI-3 Public set 的 99%。TFenrir称,Schema 搭配 Fable+4.8 可达 99%,搭配 GPT 5.6 Sol 为 95.35%;而 xiuyul、WalterReade 等人的转述里,高分配置又写成 Opus 4.8 + Fable 5 达到 99%,说明不同帖子对具体模型组合的说法并不完全一致。另一个相关基准来自 Greg Kamradt:他推荐的一组社区成绩是在 25 个公开游戏中拿到 78.4%,完成 160/183 个关卡,并称当前最佳前沿 LLM 的单次会话得分只有 4.5%;就现有材料看,这更像是用于衬托外层系统设计的重要性。

方法思路

多条帖子对 Schema 的核心理解比较一致。wearemammals概括为:不训练底座模型,而是改观察建模、历史验证、计划执行与修订流程。naval转述称,这个 harness 试图让 agent 以“像物理学家一样推理”的方式去玩游戏、写代码。Gary Marcus转发时提到,一种关键思路是先把经验转成程序化世界模型,再用完整历史做验证。xiuyul的几条转述进一步强调,latent world representation 在这里被做成“程序”而非向量,并把 analysis-by-synthesis、representation finding 直接编码进 harness。Greg Kamradt转述的经验则是:面对新任务时,先用动作摸清规则与约束,而不是立刻冲目标。

争议与存疑

现有帖子大多在重复高分结果,但完整评测设置、复现实验细节和误差边界并未展开;不同转述对最高分所对应的模型版本也存在出入。仅据这些帖子,当前更稳妥的结论不是 ARC-AGI-3 已被彻底解决,而是围绕它的研究重心正在明显转向自定义 harness、全历史验证、表示发现与行动效率等外层系统设计。

2026-07-16 ~ 2026-07-18 · 14 条相关

一手来源