Muse Glimmer 评测表现优于 Qwen 3.8 高强度模式
Ok-Inevitable8391 · reddit · 2026-08-26
作者对比了 Qwen 3.8 (xhigh, medium) 和 Muse Glimmer 的基准测试。Qwen xhigh 模式耗时近 30 小时且因 32K 输出限制有 16 例失败;Medium 和 Muse Glimmer 各耗时 3-4 小时。令人意外的是,Muse Glimmer 的结果优于 Qwen。作者认为虽针对隐性知识对小模型不公,但结合 RAG 后小模型可与前沿模型持平。
「模型」频道最新
- 特斯拉车载 Grok 升级为全球第一语音模型 — XFreeze · 2026-08-26
- 用户反馈 Claude Opus 5 网页版出现严重幻觉 — madhavsinghal_ · 2026-08-26
- GPT-5.6 自我剖析:共情是“受控的渗透性” — mimi10v3 · 2026-08-26
- Hugging Face 热门:Qwen3.8-Whittle-MoE-27B 模型发布 — logic65 · 2026-08-26
- 用户吐槽 Claude Opus 5 模型不可用 — marcosalvi · 2026-08-26
- Vercel GTM 工程师的 AI 模型分级榜 — brandon_galang · 2026-08-26