自建 SWE-bench 显示 Opus 5 在 Rails 代码库追平 Fable 5

sergeykarayev · x · 2026-07-28

团队在自己的 Rails 代码库上跑了一套自定义 SWE-bench:先从已合并的 PR 里推断规格,再让各个 agent 在看不到参考答案的情况下实现需求,最后从正确性、完整性和代码质量三个维度评估。

他们给出的首批结果显示,Opus 5 在质量上追平了 Fable 5,但单任务平均快约 2 分钟,成本约 10 美元,低于 Fable 5 的 14 美元。团队还提到,最近几轮发布后,榜单顶部越来越拥挤:同一组 10 个任务里,有 9 种 agent 配置的得分只差 5 分以内。后续他们会尝试更严格的评分,看看能否拉开差距。

配图展示了不同 agent 在 质量-成本 与 质量-时间 维度上的分布,Opus 5 和 Fable 5 都位于最前沿。

所属事件:Superconductor推自定义SWE-bench评估编程Agent(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →