Muse Glimmer 评测失利真相:偏爱 Numba 导致基准分数被低估

dejavucoder · x · 2026-08-20

评测者 @bnjmnmarie 发现 Muse Glimmer 在 LiveCodeBench 上仅得 76.2%(804/1,055),落后 Gemma 4 约 14 分。深挖后发现其中 175 个失败案例是因为模型偏爱使用 Numba 加速库,而 EvalScope 官方沙箱并未预装该依赖。他评测过 100+ 模型,从未见过哪个模型如此依赖 Numba——而题目本身根本不需要它。

手动装上 Numba 后还不够:编译期间内存占用过大、频繁超时(超时已放宽到 120 秒,远超他平时设置的 10 秒),最终换了一台机器才跑完,成绩恢复到约 90%。后续修复已让沙箱支持该依赖。这提醒我们:模型的真实能力可能被评测环境的依赖假设所掩盖。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →