284个真实bug基准:AI审查agent抓出93%问题,成本降63%
jiayq · x · 2026-10-01
Intent Lab 发布了一个由 284 个真实世界 bug 构成的代码审查基准,用于验证自主工程 agent 的产出质量。
- 其 review agent 抓住了 93% 的 bug,超过所有基线
- 成本比最强基线低 63%
- 数据显示 bug 一旦合入往往长期留存:修复中位耗时 33 天,近 20% 的 bug 存活超过一年,有一个超过 15 年才被发现
核心观点:当 coding agent 承担越来越多的工程工作,验证必须与生成同步扩展。
「编程与Agent」频道最新
- 递归自我改进易过拟合,Google 提出 RRSI 让 agent 泛化 — burkov · 2026-10-01
- 用 Codex 插件在 Game Boy 硬件上复刻 Minecraft,OpenAI DevDay 名场面 — pvncher · 2026-10-01
- 一张图+一句提示词做完整说话视频:30分钟5美元 — gorkem · 2026-10-01
- tldraw 推出 ChatGPT 插件:画应用逻辑图,Codex 直接生成代码 — DavidKPiano · 2026-10-01
- 把 Claude 记忆塞进笔记仓库并自动 commit — theshawwn · 2026-10-01
- 投行从业者用 Claude 业余 2 个月做出机构级金融情报平台 — nikhil_pratap · 2026-10-01