实测 Muse Spark 1.3:xhigh 档贵 50% 慢 13%,只多解一个 bug
PawelHuryn · x · 2026-09-13
开发者 PawelHuryn 公布 Muse Spark 1.3 不同推理档位的实测结果:xhigh 档得分 20,比 high 档贵 50%、慢 13%,但只多解决一个 bug;作者认为从 high 到 max 才是提升最大的一档,下一步将测试 medium 档。
作者在 FAQ 中说明:这些不是随机 bug,而是 2026 年初前沿模型都难以解决的硬问题;由不同模型家族的盲评者验证解答并校准;未被植入的 bug 不计入,OpenAI 模型会「bugmax」并报告大量真实但无关的问题,解决它们反而会让方案变复杂。
所属事件:105 个真实 bug 实测 Muse Spark 并列登顶(3 条相关)→
「模型」频道最新
- 2B 开源模型登上小模型榜首,实测可离线跑在 iPhone 当私人助理 — SimplyAnnisa · 2026-09-13
- OpenAI 暂停 Pro 新订阅,用户 Codex 额度用尽后无法续费 — andimarafioti · 2026-09-13
- 上海 AI Lab 发布 Intern-S2-397B:主打科学智能与长程 Agent — jacek2023 · 2026-09-13
- 博主用 GPTZero 自测文章,AI 尚未学会模仿其写作风格 — michalmalewicz · 2026-09-13
- GPT-6 Astra 满分通关 25 款 ARC-AGI-3 游戏,最优率达 80% — i_dg23 · 2026-09-13
- OpenAI 宣称模型为千禧年难题 Navier-Stokes 构造反例 — victor_explore · 2026-09-13