单卡跑满 256k 上下文:实测 Muse Glimmer 30B 本地部署显存与性能

coder543 · reddit · 2026-08-10

开发者在单张 RTX 3090 上对 Muse Glimmer 30B 模型进行了本地部署实测。结果显示,在使用 Q4KXL 量化、DFlash 以及 mmproj 的情况下,该模型可以完整支持 256k 上下文,显存占用仅约 22-23GB,表现远优于同级别的 Qwen3.6-27B 和 Gemma-4-31B。

性能数据:

相比之下,Qwen3.6-27B 在相同显存下使用 Q8 KV cache 仅能支持约 12.5 万 token,而 Muse Glimmer 的优异显存控制使其完全摆脱了对昂贵工作站(如 DGX Spark)的依赖。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →