AgentBug-Smith 论文:顶级编码智能体仅能修复 9% 的智能体框架 Bug
rohanpaul_ai · x · 2026-10-03
一篇来自芝加哥大学、复旦、清华、UIUC 等机构的研究介绍 AgentBug-Smith:一套自动从开源智能体系统中发现并复现真实 harness bug 的方法,可把这些 bug 转成可运行测试,并构建了持续增长的 Live-Harness-Bench(目前含 200 个可复现 bug)。
关键发现:
- AgentBug-Smith 复现 harness bug 的成功率比面向通用软件的现有技术高 10.67%–27.56%。
- 智能体自身代码(工具调用、记忆、prompt)的 bug 依赖真实的模型调用,难以复现与测试。
- 在该基准上,三个编码智能体中最好的也只修复了 9% 的 bug,而它们在普通软件 bug 上约有 40% 的修复率。
- 用过往修复经验总结的简短指南,可把智能体在 79 个未见 bug 上的正确修复数从 1 提升到 6。
作者的实用建议:在把编码智能体托付给「智能体自己的代码」之前,先让它试试你已经修过的 bug。
所属事件:AgentBug-Smith 自动发现并复现智能体框架真实 Bug(2 条相关)→
「编程与Agent」频道最新
- OpenClaw 发布 v2026.9.8:支持 GPT-6.1 Sol,43 个 PR 修复内存与启动问题 — heyneighbor · 2026-10-03
- 开发者感慨:用 AI 做提效元工具,从 bash 脚本变成完整应用 — devenbhooshan · 2026-10-03
- 开源 AI 科研助手 K-Dense BYOK 发布论文:本地运行+防篡改实验记录 — RexDouglass · 2026-10-03
- 谷歌论文:验证者干净上下文跑证明,探索者可放手试错 — solyarisoftware · 2026-10-03
- 用 Claude 打造浏览器多人 FPS,8v8 办公楼激战可免费玩 — BlackberrySoft1082 · 2026-10-03
- VoidZero 双雄登 TypeScript.fm:谈 oxlint 类型感知 lint 与 Vite 未来 — cnakazawa · 2026-10-03