PRO-LONG 用日志式 harness 在 ARC-AGI-3 得到 97.4%
srchvrs · x · 2026-07-27
PRO-LONG 通过日志式 harness 拿下 ARC-AGI-3 97.4%
这条转推介绍了一篇新预印本:作者认为,把环境交互从主任务里拆出来,放进单独的 log.txt,再让 coding agent 程序化地读写它,可以显著提升组合泛化能力。
- 成绩:PRO-LONG 在公开 ARC-AGI-3 上拿到 97.4%,使用的是 Fable 5。
- 成本:整次运行花费 1750 美元,比此前最佳 harness 方案大约 便宜 4 倍,同时少用 4 亿 token。
- 方法:作者把它概括为“面向长程推理的程序化记忆”,核心是对 log.txt 做结构化搜索,再配一个大约 30 行的 prompt。
- 开源:论文、代码、日志和 scorecard 都已放出。
作者想强调的结论是:很多任务并不需要复杂工程,简单的 harness 就能把问题“变得更像模型熟悉的分布”,而这里最关键的增益来自这层最小化的记忆结构。
所属事件:PRO-LONG 记忆框架以低成本拿下 ARC-AGI-3 高分(3 条相关)→
「编程与Agent」频道最新
- 桌面上常备一部 iPhone,让 Agent 统一驱动手机与电脑 — signulll · 2026-09-23
- Agent 架构法则:验证器可参与生成反馈,但不得直接晋升候选解 — blaizedsouza · 2026-09-23
- Drew Breunig:写 Agent 指令更像立法,而非下棋 — dbreunig · 2026-09-23
- Seroter 日报:GPT-6 与 Opus 5.5 同日发布,1/4 智能体无人监控 — rseroter · 2026-09-23
- 让 Claude 自动开终端面板装依赖,作者称 tmux 做不到 — letandrewcook · 2026-09-23
- 两小时做出幼儿互动绘本:Agent 访谈式工作流走红 — mimi10v3 · 2026-09-23