Harness Handbook 把 agent 行为映射回源码,显著提升规划准确率
omarsar0 · x · 2026-07-23
这篇论文 Harness Handbook: Making Evolving Agent Harnesses Readable, Navigable, and Editable 关注的是:当 agent harness 变复杂后,怎样把“某个行为”准确定位到源码中的具体文件、函数和状态机位置。
方法
- 通过静态分析和 LLM 辅助结构化,构建一个把运行时行为映射到源码位置的三层地图。
- 提出 BGPD(Behavior-Guided Progressive Disclosure),引导 coding agent 从系统总览逐步缩小到相关阶段、函数和文件,并用当前源码校验候选位置。
结果
在 Codex 和 Terminus-2 的 60 个修改请求上:
- 规划成功率分别从 28.3% 提升到 38.3%、从 26.7% 提升到 45.6%。
- planner token 使用量下降 12.7% 和 8.6%。
- 在与 GPT-5.5 和 Opus 4.8 参考计划的 24 次对比中,文件级和符号级 F1 都有提升。
- 完全定位失败最多下降 25.9 个百分点。
作者的核心观点是:让大型 agent harness 演化,不只是把代码改出来,更重要的是先找准“该改哪里”。
「编程与Agent」频道最新
- 作者把 agent 记忆改成陈述图后,身份冲突和旧事实失效问题明显缓解 — chrislally · 2026-07-23
- Pond 主打结果付费:多个 agent 竞争交付任务 — ThePeterMick · 2026-07-23
- Factory 上线模型路由,任务级选模可省 25% 成本 — matanSF · 2026-07-23
- Claude Code 里藏着一个 /radio 电台功能 — ryanbed · 2026-07-23
- Claude Code、Cursor 和 MCP 组成一套编程工作流 — IndraVahan · 2026-07-23
- DBOS 夏季更新称持久流吞吐提升 20 倍,补齐 Java 和 AI agent 集成 — CShorten30 · 2026-07-23