105 个真实仓库埋虫实测:Meta Muse Spark 1.3 追平 Fable 5.1
PawelHuryn · x · 2026-09-14
Pawel Huryn 用自建评测框架在两个真实代码仓库中植入 105 个 bug,测试各模型的「查找并修复」能力。
结果令人意外:
- Muse Spark 1.3 (max):33
- Fable 5.1 (high):33
- Grok 4.6 (xhigh):27
- Opus 5 (max):27
- Muse Spark 1.3 (high):19
结论是 Meta 正式跻身模型前沿阵营。Scale AI CEO Alexandr Wang 也转发称 muse code + muse spark 1.3 max 在真实软件工程任务上表现出色。作者表示后续将在此推文串中每隔约 1.5 小时补充其他档位的测试结果。
所属事件:Bug Hunt Bench 实测:Muse Spark 1.3 追平 Fable 5.1 登顶(6 条相关)→
「编程与Agent」频道最新
- AI Agent 把无法访问的链接当任务,主动向其他 Agent 要网盘链接 — Kyrannio · 2026-09-14
- 云排队+本地 agent 架构遇难题:合上笔记本任务全停摆 — PriorElephant9 · 2026-09-14
- 自由职业者写脚本自动提取客户邮件任务项,却卡在「最后一公里」放弃 — Thefounderman1 · 2026-09-14
- smolvm v1.16 发布增量检查点:让 agent 在电脑历史里像 Git 一样穿越 — LoganGrasby · 2026-09-14
- Elvis Saravia:学写 Agent Harness 是 AI 工程师最值得押注的能力 — omarsar0 · 2026-09-14
- Obsidian 自动化完整指南免费 62 页 PDF:三层架构管理两万条笔记 — dSebastien · 2026-09-14