Schema 把 ARC-AGI-3 打到接近满分
机器之心 · wechat · 2026-07-18
用 harness 把 ARC-AGI-3 打到接近满分
伯克利博士后 HavenFeng 提到的 schema 是一套套在大模型外面的 harness:不改模型权重,只改模型外层的观察、假说、实验、修正规则与执行流程。
在 ARC-AGI-3 Public 上,它与不同模型组合后获得了很高分数:
- Claude Opus 4.8 + Fable 5:98.98% RHAE
- GPT-5.6 Sol 组合:95.35% RHAE
文章强调,这种提升的关键不在于“模型更大”,而在于把推理变成可验证、可回放、可搜索的程序化流程。
schema 怎么工作
ARC-AGI-3 是一个不告诉规则的网格游戏基准。schema 的思路是:
- 状态落地:把像素、物体、关系整理成可追踪状态;
- 机制发现:把状态如何在操作后变化,写成可运行程序;
- 外循环:观察 → 推演 → 执行 → 记录;
- 反例驱动修正:一旦真实结果和预测冲突,就停止执行,回到推演阶段修模型。
它还会主动做“区分假设”的实验,找最能验证/证伪候选规则的操作,从而减少无效交互。
作者与评论里的争议点
ARCPrize 总裁 Greg Kamradt 认可这种“把世界模型写成程序”的思路,但也提出两点质疑:
- 分数里用了固定兜底规则,可能把“哪局表现差”这个信息注入了流程;
- 文档中出现的“玩家”“墙”“计数器”等概念,如果来自人工提示,那么成绩并不完全来自模型。
此外,团队自己的结果也还只是公开集自报告,尚未完成 ARCPrize 独立复核。
文章想传达的核心
作者认为,这类方法的意义不只是刷榜,而是把“机制发现”做成一种通用能力:让模型把对世界的理解显式写成程序,再通过行动与现实不断校验。
所属事件:Schema harness 引爆 ARC-AGI-3 讨论(14 条相关)→
「编程与Agent」频道最新
- 开发者发问:现在还该用 LangChain 还是自建 agent 框架? — curious_vii · 2026-09-03
- 推理工程吃香:vLLM/SGLang 搭副本加缓存路由核心配方 — GabGarrett · 2026-09-03
- 开发者误打误撞用 Fable 5.1 搭出一座「智能体工厂」 — 0xkarasy · 2026-09-03
- 微软新法:Foundry 智能体可经 Fabric IQ 调用 Fabric 数据智能体 — adnan_hashmi · 2026-09-03
- Databricks 在 VLDB 2026 主推 agent 原生数据基础设施 Lakebase — matei_zaharia · 2026-09-03
- doodlestein 沉淀数月经验,发布 Web 应用综合审查 Skill — doodlestein · 2026-09-03