PRO-LONG 用日志式 harness 在 ARC-AGI-3 得到 97.4%
srchvrs · x · 2026-07-27
PRO-LONG 通过日志式 harness 拿下 ARC-AGI-3 97.4%
这条转推介绍了一篇新预印本:作者认为,把环境交互从主任务里拆出来,放进单独的 log.txt,再让 coding agent 程序化地读写它,可以显著提升组合泛化能力。
- 成绩:PRO-LONG 在公开 ARC-AGI-3 上拿到 97.4%,使用的是 Fable 5。
- 成本:整次运行花费 1750 美元,比此前最佳 harness 方案大约 便宜 4 倍,同时少用 4 亿 token。
- 方法:作者把它概括为“面向长程推理的程序化记忆”,核心是对 log.txt 做结构化搜索,再配一个大约 30 行的 prompt。
- 开源:论文、代码、日志和 scorecard 都已放出。
作者想强调的结论是:很多任务并不需要复杂工程,简单的 harness 就能把问题“变得更像模型熟悉的分布”,而这里最关键的增益来自这层最小化的记忆结构。
「编程与Agent」频道最新
- 团队称 Fable 吃掉了首周 AI 工作流 30% 成本 — gabrielchua · 2026-07-27
- 自动改代码很快,却仍然缺少真正协作 — josh_wills · 2026-07-27
- Codex 循环线程开始每周自动做诗歌点评和清单整理 — andrew_n_carr · 2026-07-27
- AI agent 账单飙到 1279 美元,团队开始吐槽该裁掉谁 — HaktanSuren · 2026-07-27
- NVIDIA 开源 Molt:面向 Agentic 强化学习的训练框架 — nvidia · 2026-07-27
- Skill Self-Play 用共进化技能提升 LLM 能力上限 — QwenBusinessUnit-Edu · 2026-07-27