用户实测指 Muse Spark 1.3 疑似刷榜:实际表现远逊基准分

Swimming_Gain_4989 · reddit · 2026-09-05

一位 Reddit 用户通过 OpenRouter 和 Opencode Zen 两个渠道、更换 system prompt、脱离 harness 等多种方式测试 Muse Spark 1.3,结果都很差,怀疑该模型为基准测试过度优化(benchmaxxed)。

实测场景:

作者强调只是提供一个数据点,不想挑起争论。

所属事件:实测打脸榜单:Muse Spark 1.3 高分遭质疑刷榜(4 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →