Muse Glimmer 评测表现优于 Qwen 3.8 高强度模式

Ok-Inevitable8391 · reddit · 2026-08-26

作者对比了 Qwen 3.8 (xhigh, medium) 和 Muse Glimmer 的基准测试。Qwen xhigh 模式耗时近 30 小时且因 32K 输出限制有 16 例失败;Medium 和 Muse Glimmer 各耗时 3-4 小时。令人意外的是,Muse Glimmer 的结果优于 Qwen。作者认为虽针对隐性知识对小模型不公,但结合 RAG 后小模型可与前沿模型持平。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →