AgentBug-Smith: Automatically Reproducing Real-World Harness Bugs in Agentic Systems
Yiming Cheng, Alfin Wijaya Rahardja, Mengshi Zhang, Zihao Chen, Zhenpeng Chen, Yiling Lou
The University of Chicago / Fudan University / TensorBlock, Inc / Tsinghua University / University of Illinois Urbana-Champaign
cs.SE, cs.AI
2026-09-29
全自动流水线从开源 agent 仓库复现真实 harness bug,成功率最高 28%,攒出 200 例活基准;SOTA 修复智能体在基准上仅修好 9%。
Agent 系统由 backbone LLM 和 harness 组成。harness 是包在模型外面的软件层,管上下文、工具接入、编排和安全护栏,OpenClaw 的 harness 已写到 20 万行。这一层的实现 bug 正成为 agent 故障的重要来源,且和普通软件 bug 不是一个物种:它们长在 agent 特有的结构里,涉及与工具、模型服务、网络服务的交互,往往只在特定执行状态下才暴露。
测量结果很难看:软件修复 agent 修 harness bug 的成功率只有 4.67%,修普通软件 bug 能到 40.67%。想推进这个方向,先得有可执行的 benchmark,但唯一的 AgentIssue-Bench 只有 43 个 bug、花了 150 人工小时,规模固定且有训练数据污染风险。SWE-Factory、SWE-bench-Live 这类自动复现流水线为普通软件设计,遇到重度依赖外部资源的 agent 仓库基本失灵。
AgentBug-Smith 是全自动多智能体流水线,分三段:
225 个 harness bug issue 上的复现成功率,同一流水线换三个 backbone:
| 驱动模型 | SWE-Factory | SWE-bench-Live | AgentBug-Smith |
| GPT-4.1-mini | 9.33% | 2.67% | 20.00% |
| Kimi-k2.5 | 8.44% | 2.67% | 20.44% |
| DeepSeek-v3.2 | 13.78% | 0.44% | 28.00% |
领先 10.6727.56 个百分点,单 issue 成本 0.562.44 美元。各模型汇总复现 75 个 bug,其中 45 个两个基线都做不出来;人工核验 74/75(98.67%)忠实复现了 issue 描述的故障。识别环节本身:仓库判定准确率 95%、issue 判定 92%,vanilla LLM 调用只有 35% 和 46%。
产出的 Live-Harness-Bench 当前收录 200 个可复现 bug:仓库平均 12.3 万行代码,金补丁平均改动 202.9 行;31.5% 涉及工具注册与动作接口,30.5% 涉及上下文与记忆管理,最新的 bug 报告于 2026 年 8 月。
三个主流修复 agent(均用 GPT-4.1-mini 驱动)在基准上:
| Agent | plausibly resolved | correctly resolved |
| mini-SWE-agent | 19.50% | 9.00% |
| OpenHands | 17.50% | 8.50% |
| AutoCodeRover | 6.00% | 3.50% |
plausibly resolved 指补丁通过复现测试,correctly resolved 还要人工确认与开发者补丁语义等价。对照这些 agent 在 SWE-Bench Verified 上报告过的 40.67%,harness bug 是另一档难度。再把基准当知识库用(121 个训练、79 个测试,同一仓库不跨集),蒸馏出一份 SKILL.md 纯文本技能挂给 mini-SWE-agent,正确修复率从 1.27% 提到 7.59%,函数级定位从 34.60% 提到 66.41%。
这是第一个能跟着上游持续生长的可执行 harness bug 基准。人工路线 150 小时换 43 个 bug,这条流水线按 issue 付几美元攒出 200 个,还能随新 issue 持续扩充,把污染窗口不断往后推。
9% 对 40.67% 钉死了一件事:在普通软件上刷高的修复 agent,迁到 harness 代码上能力直接塌掉。要证明「agent 修 agent」的水平,得用这类基准说话,通用 SWE 分数撑不起来。
技能蒸馏实验给出了正循环的雏形:真实故障和修复流进基准,基准反哺修复 agent。基准越大,这个循环越转得动。
复现成功率天花板就是 28%:三个模型各有 162180 次失败尝试,大头在环境构建(依赖安装、Docker 配置、容器磁盘耗尽),失败分布还随 backbone 变化,论文自己承认目前没有通用解法。联合优化的证据只有 AgentScope #1297 一个个案 trace,作者明说这是代表性执行记录,不是因果消融。
下游实验规模小:蒸馏测试集只有 79 个 bug,提升起点是 1.27% 这种近零基数,7.59% 的绝对水平仍然很低,且只在 mini-SWE-agent 一个 agent 上验证过。另外,两个基线本来就不为 harness bug 设计,赢下它们说明的是「通用技术不可迁移」;这条流水线离实用有多远,28% 的复现率本身就是答案。