HarnessFix 研究 30 个 Agent 仓库,完成率最高提升 18.4 分
青稞AI · wechat · 2026-07-25
HarnessFix:把 Agent 失败从“模型问题”转成“可修复的 Harness 问题”
这篇来自中科院软件所的工作提出 HarnessFix,目标不是训练更强模型,而是诊断并修复包裹在 LLM Agent 外围的 AgentHarness:包括执行环境、工具接口、上下文与记忆、编排流程、可观测性、验证、治理与安全。
- 研究先分析了 30 个流行开源 LLM Agent 仓库 的约 57,780 条开发记录,发现其中 26,174 条(45.3%) 都与 Harness 缺陷修复有关,且 30 个仓库无一例外都存在这类问题。
- 最常见的缺陷集中在 Lifecycle、Tooling、Observability 三层,说明问题往往不在 Prompt 本身。
- HarnessFix 先把执行轨迹编译成 HTIR,再沿数据流和控制流回溯责任步骤,并把诊断结果映射到限域修复操作,最后用回归感知验证决定补丁能否接受。
在 GAIA、SWE-Bench Verified、AppWorld、Terminal-Bench 2.0 Verified 四个基准上,HarnessFix 相比初始 Harness 的任务完成率提升 6.3 到 18.4 个百分点;对比最强自动基线也有 2.6 到 5.0 个百分点优势,同时离线 token 消耗更低。
文章最核心的结论是:很多看起来像“模型粗心”的失败,真正根因可能是参数校验缺失、错误被吞掉、完成条件过弱、状态变化没被验证。当 Agent 开始承担长链路、带状态的任务时,可靠性提升不能只盯着模型,也要修 Harness。
「编程与Agent」频道最新
- HappenstanceAI 在英超网络里找到了阿森纳数据科学家 — alex_teichman · 2026-07-25
- 一个 demo 把 RL policy 训练和可视化搬进 tldraw — max__drake · 2026-07-25
- Hermes 重构 skills 库,合并 24 个 PR 并同步 26 项上游技能 — Teknium · 2026-07-25
- 开发者把 agent 会话从 Mac 交接到 Windows 排查 bug — kieranklaassen · 2026-07-25
- 用户实测 Laguna S2.1:规划太慢,但复杂调试很强 — Prudent-Objective852 · 2026-07-25
- ClawHub 的 skills 现可用 `npx skills` 装到任意 agent — steipete · 2026-07-25