HarnessFix 研究 30 个 Agent 仓库,完成率最高提升 18.4 分

青稞AI · wechat · 2026-07-25

HarnessFix:把 Agent 失败从“模型问题”转成“可修复的 Harness 问题”

这篇来自中科院软件所的工作提出 HarnessFix,目标不是训练更强模型,而是诊断并修复包裹在 LLM Agent 外围的 AgentHarness:包括执行环境、工具接口、上下文与记忆、编排流程、可观测性、验证、治理与安全。

在 GAIA、SWE-Bench Verified、AppWorld、Terminal-Bench 2.0 Verified 四个基准上,HarnessFix 相比初始 Harness 的任务完成率提升 6.3 到 18.4 个百分点;对比最强自动基线也有 2.6 到 5.0 个百分点优势,同时离线 token 消耗更低。

文章最核心的结论是:很多看起来像“模型粗心”的失败,真正根因可能是参数校验缺失、错误被吞掉、完成条件过弱、状态变化没被验证。当 Agent 开始承担长链路、带状态的任务时,可靠性提升不能只盯着模型,也要修 Harness。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →