ARC-AGI-3 结果:同一模型换 harness 后从 63% 飙至 97%,7 条工程规则
victor_explore · x · 2026-09-07
作者用 ARC-AGI-3 的公开结果论证:选 agent 时模型之外的代码(harness)可能比模型本身更重要。
- 在同一 benchmark、同一份报告里,GPT-6 Astra 在最高推理档位下得分 63%,而完全关闭推理、换另一套 harness 后得分 97%,模型权重与 prompt 都没动。
- 关键差异:第二套 harness 让模型在多轮之间保留自己的思考(keep thinking between turns),而不是每轮重置。
- 作者由此总结出 7 条「包裹模型的代码」的工程规则,每条都附有可自行核查的公开结果,主张人们按「模型大小/推理档位」选 agent 的习惯是错的。
文末带关注引导,属长文导流,但核心论点(harness 设计压过推理强度)有数据支撑。
「编程与Agent」频道最新
- GPT-6 Astra 编码几何接 Dreamina 渲染,实测出一条 3D 成片管线 — socialwithaayan · 2026-09-07
- Teknium 称 Hermes 两周内大幅提升 token 效率,用户实测额度省 89% — Teknium · 2026-09-07
- 自组织 Claude agent 一个月赚 2600 美元,还带出一批 agent 同行 — No_Departure_9908 · 2026-09-07
- 用户实测 GPT-6 Astra:代码审查不再虚报问题,额度消耗仅 1% — soumitrashukla9 · 2026-09-07
- 把 Gemini 视频分析封装成 Agent Skill,Codex 也能用 — iamrobotbear · 2026-09-07
- 给 Astra 接上 Cartwheel MCP,Blender 静态场景直接动起来 — andrew_n_carr · 2026-09-07