IBM Bob 实测 SWE-bench:解决 60.6% 真实 bug,单任务成本约 1 美元

TejasKumar_ · x · 2026-08-19

Tejas Kumar 对 IBM 的编码 agent Bob 跑了 SWE-bench Verified:从 Django、scikit-learn、sympy 等 12 个成熟 Python 项目取 500 个真实 bug,agent 在修复前的 commit 上打补丁,由项目自身测试套件判定。

核心结果:

文章说明了 SWE-bench Verified 的判分机制(FAILTOPASS + PASSTOPASS 双绿才算通过,等价于维护者审 PR 的标准),并附了如何自己复现同一评测的方法。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →