自建 SWE-bench 显示 Opus 5 在 Rails 代码库追平 Fable 5
sergeykarayev · x · 2026-07-28
团队在自己的 Rails 代码库上跑了一套自定义 SWE-bench:先从已合并的 PR 里推断规格,再让各个 agent 在看不到参考答案的情况下实现需求,最后从正确性、完整性和代码质量三个维度评估。
他们给出的首批结果显示,Opus 5 在质量上追平了 Fable 5,但单任务平均快约 2 分钟,成本约 10 美元,低于 Fable 5 的 14 美元。团队还提到,最近几轮发布后,榜单顶部越来越拥挤:同一组 10 个任务里,有 9 种 agent 配置的得分只差 5 分以内。后续他们会尝试更严格的评分,看看能否拉开差距。
配图展示了不同 agent 在 质量-成本 与 质量-时间 维度上的分布,Opus 5 和 Fable 5 都位于最前沿。
所属事件:Superconductor推自定义SWE-bench评估编程Agent(2 条相关)→
「编程与Agent」频道最新
- IBM 推出面向 AI agents 的免费图工程课程 — goyalshaliniuk · 2026-07-28
- 从凌晨4点狂发帖学到的教训:实战解析全自动社媒Agent架构 — Suitable-Nerve-9041 · 2026-07-28
- 观点:智能体动态自建专属工具流将是重大趋势 — burny_tech · 2026-07-28
- Agent 未来会按任务临时生成专用 harness — corbtt · 2026-07-28
- 零编程背景创业者搭出社媒智能体流水线 — Apprehensive_Slide20 · 2026-07-28
- Swarms 对比 LangGraph,称图式 Agent 工作流代码减半 — KyeGomezB · 2026-07-28