105 个真实仓库埋虫实测:Meta Muse Spark 1.3 追平 Fable 5.1

PawelHuryn · x · 2026-09-14

Pawel Huryn 用自建评测框架在两个真实代码仓库中植入 105 个 bug,测试各模型的「查找并修复」能力。

结果令人意外:

结论是 Meta 正式跻身模型前沿阵营。Scale AI CEO Alexandr Wang 也转发称 muse code + muse spark 1.3 max 在真实软件工程任务上表现出色。作者表示后续将在此推文串中每隔约 1.5 小时补充其他档位的测试结果。

所属事件:Bug Hunt Bench 实测:Muse Spark 1.3 追平 Fable 5.1 登顶(6 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →