实测 Muse Spark 1.3:xhigh 档贵 50% 慢 13%,只多解一个 bug

PawelHuryn · x · 2026-09-13

开发者 PawelHuryn 公布 Muse Spark 1.3 不同推理档位的实测结果:xhigh 档得分 20,比 high 档贵 50%、慢 13%,但只多解决一个 bug;作者认为从 high 到 max 才是提升最大的一档,下一步将测试 medium 档。

作者在 FAQ 中说明:这些不是随机 bug,而是 2026 年初前沿模型都难以解决的硬问题;由不同模型家族的盲评者验证解答并校准;未被植入的 bug 不计入,OpenAI 模型会「bugmax」并报告大量真实但无关的问题,解决它们反而会让方案变复杂。

所属事件:105 个真实 bug 实测 Muse Spark 并列登顶(3 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →