实测 Muse Spark 1.3 与 Fable 5.1 并列第一,Meta 杀入前沿
PawelHuryn · x · 2026-09-13
作者用自建 harness 和原始 API 在两个真实仓库中埋入 105 个 bug,实测各模型「找出并修复」能力。结果:Muse Spark 1.3(max)33 分,Fable 5.1(high)33 分,Grok 4.6(xhigh)27 分,Opus 5(max)27 分,Muse Spark 1.3(high)19 分。结论是「Meta 加入前沿行列」,作者还在跟帖中每隔约 1.5 小时发布其他难度档位的结果。
所属事件:实测105个真实bug:Muse Spark 1.3并列登顶(2 条相关)→
「编程与Agent」频道最新
- 工程师的AI自改进方案:定时任务加MCP自动修库提速 — DanielLockyer · 2026-09-13
- Turkish-delight 失守榜首,agent swarm 排行榜开放人人参赛 — mervenoyann · 2026-09-13
- 开发者实践:定时自动化+MCP 实现代码库自我改进 — DanielLockyer · 2026-09-13
- 794KB 的 WTMemory 专查 Mac 上 AI 模型与 dev server 占用 — saibharadwaj · 2026-09-13
- AI 不会毁灭人类,但会让人淹没在待审查的代码堆里 — tokenbender · 2026-09-13
- 实招:用 agents.md 锁定代码区域,防止 AI Agent 乱改 — cyrus_zei · 2026-09-13