SWE-Together 榜单更新:Claude Fable 5 登顶,Muse Spark 1.3 成性价比之王
shuchaobi · x · 2026-09-11
SWE-Together 是一个含 109 个真实编码任务、带模拟用户在环的编码智能体基准,本次更新揭示了几组关键结论:
- Claude Fable 5 登顶(judge 61%),5.1 以 57% 紧随其后。两者巅峰表现相当,差距在稳定性:Fable 5.1 有 14 次试验得零分,Fable 5 只有 6 次。但 5.1 快 25%、便宜约 2 倍、需要的用户纠错也略少(1.45 vs 1.53 次/任务)。
- Meta Muse Spark 1.3 是性价比离群值:每解决一个任务的成本约为 Fable 5.1 的 1/2.5、Fable 5 的 1/5,性能上接近中游(47%)。
- 榜单上还有 claude-opus-4.8(52%)、gpt-5.5(48%,token 消耗最低之一)、glm-5.2(42%)、deepseek-v4-pro(29%)、minimax-2.7(24%)等。
- 基准用 opencode harness,k=2,同时报告 pass@1 与 pass²(两次都成功),悬空部分代表不稳定。
「编程与Agent」频道最新
- 光靠 Prompt 恐吓不行,大厂用约束解码锁死 JSON 输出 — dotey · 2026-09-11
- supermemory 砍掉公司/个人脑产品,全力押注 Agent 记忆 API — julianweisser · 2026-09-11
- 妻子 AI 退款 agent 对上对方 AI,秒级邮件乒乓大战 — robleclerc · 2026-09-11
- visual-explainer:把终端输出变成精美 HTML 页面的 Agent Skill — tom_doerr · 2026-09-11
- 一句话测出模型是否降智:让 AI 用 SVG 画骑车的鹈鹕 — lxfater · 2026-09-11
- Shopify 宣布全面弃用 React Native,移动端回归 Swift 与 Kotlin — SumitGup · 2026-09-11