实测 105 个真实 bug:Muse Spark 1.3 并列登顶,Meta 逼近前沿
PawelHuryn · x · 2026-09-13
博主 PawelHuryn 用两个真实仓库、预埋 105 个 bug 的私有基准实测了新模型 Muse Spark 1.3(max 档)。
- 结果:Muse Spark 1.3(max)与 Fable 5.1(high)并列 33 分居首,Grok 4.6(xhigh)与 Opus 5(max)均 27,Muse Spark 1.3(high)仅 19。作者判断「Meta 加入了前沿行列」。
- 基准方法论说明:这些是 2026 年初前沿模型真实挣扎过的硬 bug,不能读作「最强模型只解了 48/105」;用异家族模型做盲评 judge 且校准过;未预埋的 bug 不计分;答案库私密,公开的是匿名日志与覆盖率。
- 有趣发现:OpenAI 系模型「bugmax」倾向——报告大量真实但不相干的问题,修它们反而常把方案搞复杂。
- 其他 effort 档位结果陆续在原线程更新;被最多人要求的 Muse Spark 1.3 已补测。
所属事件:105 个真实 bug 实测 Muse Spark 并列登顶(3 条相关)→
「编程与Agent」频道最新
- 开源 Fulmar:把 DeepSeek Agent 装进 Mac 原生应用 — absolutefunnyguy · 2026-09-13
- AFK Pilot:用手机浏览器远程操控 Grok、Codex 与 Claude Code — PawelHuryn · 2026-09-13
- AI 工程师学习路线:先做项目,再自顶向下深挖补基础 — ashishllm · 2026-09-13
- 开源 Forma:用 AI 从图片 PDF 自动生成 DevExpress 报表布局 — waqarsyd · 2026-09-13
- 15天给 Hermes Agent 加50项能力:从聊天框变成个人操作系统 — Teknium · 2026-09-13
- 用 Virtual Runtime 网关统一治理 Agent 的 MCP 流量 — bibryam · 2026-09-13