105 个真实 bug 实测 Muse Spark 并列登顶

开发者 PawelHuryn 用自建 harness 与原始 API,在两个真实仓库中预埋 105 个 bug,实测各模型「找出并修复」的能力。结果 Muse Spark 1.3(max 档)以 33 分与 Fable 5.1 并列第一,显示 Meta 已杀入前沿模型行列。他另测不同推理档位:xhigh 档仅比 high 档多解一个 bug,却贵 50%、慢 13%,性价比存疑。

2026-09-13 ~ 2026-09-13 · 3 条相关