用户实测指 Muse Spark 1.3 疑似刷榜:实际表现远逊基准分
Swimming_Gain_4989 · reddit · 2026-09-05
一位 Reddit 用户通过 OpenRouter 和 Opencode Zen 两个渠道、更换 system prompt、脱离 harness 等多种方式测试 Muse Spark 1.3,结果都很差,怀疑该模型为基准测试过度优化(benchmaxxed)。
实测场景:
- OpenGL shader 组合与 Godot 调试:尚可,约相当于 DeepSeek v4 flash 水平,非前沿;
- 文档快速参考(Typescript/Go):勉强及格;
- 高阶离散数学辅导(组合数学、贝叶斯概率、图论):表现如 GPT-4 mini,无法维持多轮对话,练习题不完整、解题解释常出错。
作者强调只是提供一个数据点,不想挑起争论。
所属事件:实测打脸榜单:Muse Spark 1.3 高分遭质疑刷榜(4 条相关)→
「模型」频道最新
- 评测者盛赞 OpenAI GPT-6-Astra:会猜到你想要什么,能力直逼 Fable — pvncher · 2026-09-05
- Meta 发布 Muse Spark 1.3:最大推理模式上线,主打「前沿性能不前沿价格」 — AIatMeta · 2026-09-05
- 用户吐槽:模型开始编造词典里根本不存在的词 — StewartalsopIII · 2026-09-05
- Alexandr Wang预告Muse Spark 1.3:推理等级可设至max — alexandr_wang · 2026-09-05
- Muse Spark 1.3 max 公开发布,编码与智能体性能显著提升 — jordihays · 2026-09-05
- Alexandr Wang 官宣 Muse Spark 1.3 max 发布,编码与智能体能力显著增强 — alexandr_wang · 2026-09-05