HarnessFix 研究 30 个 Agent 仓库,完成率最高提升 18.4 分
青稞AI · wechat · 2026-07-25
HarnessFix:把 Agent 失败从“模型问题”转成“可修复的 Harness 问题”
这篇来自中科院软件所的工作提出 HarnessFix,目标不是训练更强模型,而是诊断并修复包裹在 LLM Agent 外围的 AgentHarness:包括执行环境、工具接口、上下文与记忆、编排流程、可观测性、验证、治理与安全。
- 研究先分析了 30 个流行开源 LLM Agent 仓库 的约 57,780 条开发记录,发现其中 26,174 条(45.3%) 都与 Harness 缺陷修复有关,且 30 个仓库无一例外都存在这类问题。
- 最常见的缺陷集中在 Lifecycle、Tooling、Observability 三层,说明问题往往不在 Prompt 本身。
- HarnessFix 先把执行轨迹编译成 HTIR,再沿数据流和控制流回溯责任步骤,并把诊断结果映射到限域修复操作,最后用回归感知验证决定补丁能否接受。
在 GAIA、SWE-Bench Verified、AppWorld、Terminal-Bench 2.0 Verified 四个基准上,HarnessFix 相比初始 Harness 的任务完成率提升 6.3 到 18.4 个百分点;对比最强自动基线也有 2.6 到 5.0 个百分点优势,同时离线 token 消耗更低。
文章最核心的结论是:很多看起来像“模型粗心”的失败,真正根因可能是参数校验缺失、错误被吞掉、完成条件过弱、状态变化没被验证。当 Agent 开始承担长链路、带状态的任务时,可靠性提升不能只盯着模型,也要修 Harness。
「编程与Agent」频道最新
- 受 OpenAI 万机群启发,开发者开源 agent 众包解题平台 — Benjaminsen · 2026-09-11
- 开源 Mac 应用 Lucid:只在跑 AI 时阻止笔记本休眠 — Pitiful_Hedgehog_600 · 2026-09-11
- 20kb 函数匹配达成,banteg 召集 AI 逆向 Snail Mail 剩余 20 个挑战 — banteg · 2026-09-11
- Alex Townsend 汇编 200 个数值线性代数开放问题,供人类与 AI 攻关 — IgorCarron · 2026-09-11
- Kimi K2.8 Preview 上线:性能接近 K3、1M 上下文全档开放 — teortaxesTex · 2026-09-11
- 有人想给软件工程任务建「形态分类」数据库,好按任务选模型 — StewartalsopIII · 2026-09-11