Muse Glimmer 评测失利真相:偏爱 Numba 导致基准分数被低估
dejavucoder · x · 2026-08-20
评测者 @bnjmnmarie 发现 Muse Glimmer 在 LiveCodeBench 上仅得 76.2%(804/1,055),落后 Gemma 4 约 14 分。深挖后发现其中 175 个失败案例是因为模型偏爱使用 Numba 加速库,而 EvalScope 官方沙箱并未预装该依赖。他评测过 100+ 模型,从未见过哪个模型如此依赖 Numba——而题目本身根本不需要它。
手动装上 Numba 后还不够:编译期间内存占用过大、频繁超时(超时已放宽到 120 秒,远超他平时设置的 10 秒),最终换了一台机器才跑完,成绩恢复到约 90%。后续修复已让沙箱支持该依赖。这提醒我们:模型的真实能力可能被评测环境的依赖假设所掩盖。
「模型」频道最新
- 用户吐槽 Sonnet 5 速度慢且贵,缺乏使用场景 — kimmonismus · 2026-08-20
- 新版 GPT 图像模型测试:文字渲染大幅增强 — apples_jimmy · 2026-08-20
- 老用户惊叹:H3 Minimax 的震撼力超乎预期 — Parogarr · 2026-08-20
- 网友调侃 Fable V 太智能不屑对话 — repligate · 2026-08-20
- S1-mini 模型登录 Hugging Face — _akhaliq · 2026-08-20
- ChatGPT 桌面端现离奇幻觉问题 — bulutarkan · 2026-08-20