IBM Bob 实测 SWE-bench:解决 60.6% 真实 bug,单任务成本约 1 美元
TejasKumar_ · x · 2026-08-19
Tejas Kumar 对 IBM 的编码 agent Bob 跑了 SWE-bench Verified:从 Django、scikit-learn、sympy 等 12 个成熟 Python 项目取 500 个真实 bug,agent 在修复前的 commit 上打补丁,由项目自身测试套件判定。
核心结果:
- 解决率 303/500(60.6%)
- 单任务中位成本 $1.05,中位延迟 209 秒
- 一次性跑完共花费 $775.05、37.6 agent 小时,无重试
文章说明了 SWE-bench Verified 的判分机制(FAILTOPASS + PASSTOPASS 双绿才算通过,等价于维护者审 PR 的标准),并附了如何自己复现同一评测的方法。
「编程与Agent」频道最新
- Weaviate Query Agent 升级:搜索前先自动摸清数据分布与可选值 — CShorten30 · 2026-08-19
- Artificial Analysis 发布搜索 API 基准:Parallel、Exa 表现最佳 — ArtificialAnlys · 2026-08-19
- ICML 论文:测量 LLM 概念一致性,减少 Agent 中的自我矛盾 — soumitrashukla9 · 2026-08-19
- DataSmith 自动智能体:仅靠数据干预超越模型架构优化 — josh_wills · 2026-08-19
- Agent 生产部署常崩盘?OpenClaw 蓝图解构架构设计 — aftahi_ai · 2026-08-19
- Google VRP 规则镜像至 GitHub 助力自动化 — moyix · 2026-08-19