AgentBug-Smith 论文:顶级编码智能体仅能修复 9% 的智能体框架 Bug
rohanpaul_ai · x · 2026-10-03
作者补充了论文链接:arXiv 论文《AgentBug-Smith: Automatically Reproducing Real-World Harness Bugs in Agentic Systems》,作者来自芝加哥大学、复旦大学、TensorBlock、清华大学与伊利诺伊大学香槟分校。
该工作提出自动复现智能体框架(harness)真实 bug 的方法:相比现有面向通用软件的 bug 复现技术,在不同骨干 LLM 上成功率高出 10.67%–27.56%。由此构建的 Live-Harness-Bench 目前含 200 个可复现 harness bug。系统评测显示最先进的软件智能体在修复真实 harness bug 上能力有限,而将历史修复经验整理为指南可显著提升修复表现。
所属事件:AgentBug-Smith 自动发现并复现智能体框架真实 Bug(2 条相关)→
「编程与Agent」频道最新
- Anthropic 工程师:未来模型将更擅长删代码与化简 — simpsoka · 2026-10-03
- 好的 AI 工作流不是点击最少,而是把摩擦留在会出错的地方 — alifcoder · 2026-10-03
- 用 Opus 5.5 从零做浏览器 3D 游戏,AI 开发实战亮相 — jason_mayes · 2026-10-03
- Cloudflare Durable Objects 支持无客户端时继续长任务 — threepointone · 2026-10-03
- 开发者嫌 nbviewer 常崩,自研纯浏览器端 notebook 渲染器并开源 — cneuralnetwork · 2026-10-03
- 规模化后人工盯不住:AI 系统监控自动化的必要清单 — goyalshaliniuk · 2026-10-03