Agent harness 刷 ARC-AGI-3

naval · x · 2026-07-16

Impossible Research 团队介绍了一个 agent harness:它能玩游戏、写代码,并以“像物理学家一样推理”的方式运行。

帖子引用了 [schema] 的成绩:在 ARC-AGI-3 Public set 上,使用 Opus 4.8 + Fable 5 达到 99% RHAE,使用 GPT-5.6 Sol 达到 95.35%。作者的核心主张是,这套 harness 能把 LLM 组织成更适合高难推理与任务执行的工作流。

所属事件:Schema harness 引爆 ARC-AGI-3 讨论(14 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →