Harness Handbook 把 agent 行为映射回源码,显著提升规划准确率
omarsar0 · x · 2026-07-23
这篇论文 Harness Handbook: Making Evolving Agent Harnesses Readable, Navigable, and Editable 关注的是:当 agent harness 变复杂后,怎样把“某个行为”准确定位到源码中的具体文件、函数和状态机位置。
方法
- 通过静态分析和 LLM 辅助结构化,构建一个把运行时行为映射到源码位置的三层地图。
- 提出 BGPD(Behavior-Guided Progressive Disclosure),引导 coding agent 从系统总览逐步缩小到相关阶段、函数和文件,并用当前源码校验候选位置。
结果
在 Codex 和 Terminus-2 的 60 个修改请求上:
- 规划成功率分别从 28.3% 提升到 38.3%、从 26.7% 提升到 45.6%。
- planner token 使用量下降 12.7% 和 8.6%。
- 在与 GPT-5.5 和 Opus 4.8 参考计划的 24 次对比中,文件级和符号级 F1 都有提升。
- 完全定位失败最多下降 25.9 个百分点。
作者的核心观点是:让大型 agent harness 演化,不只是把代码改出来,更重要的是先找准“该改哪里”。
所属事件:Harness Handbook 提出行为地图提升 Agent 规划与编辑效率(2 条相关)→
「编程与Agent」频道最新
- Kernel 接入 Stripe Link:浏览器 Agent 一行 API 即可安全付款 — jeff_weinstein · 2026-09-11
- 同题 Echo Maze 实测:三大模型看似成功,代码里藏着同一个 bug — eyishazyer · 2026-09-11
- 3D 网站生成工作流公开:MCP 接 Codex,一句话出可玩游戏 — FellMentKE · 2026-09-11
- 用 GPT-6 Astra 加 Hyper3D MCP 免建模做 3D 落地页 — FellMentKE · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11
- Codex 用户实测:Sol 搭配 Astra/Luna 子代理更省额度 — pvncher · 2026-09-11