实测 Muse Spark 1.3 与 Fable 5.1 并列第一,Meta 杀入前沿

PawelHuryn · x · 2026-09-13

作者用自建 harness 和原始 API 在两个真实仓库中埋入 105 个 bug,实测各模型「找出并修复」能力。结果:Muse Spark 1.3(max)33 分,Fable 5.1(high)33 分,Grok 4.6(xhigh)27 分,Opus 5(max)27 分,Muse Spark 1.3(high)19 分。结论是「Meta 加入前沿行列」,作者还在跟帖中每隔约 1.5 小时发布其他难度档位的结果。

所属事件:实测105个真实bug:Muse Spark 1.3并列登顶(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →