单卡跑满 256k 上下文:实测 Muse Glimmer 30B 本地部署显存与性能
coder543 · reddit · 2026-08-10
开发者在单张 RTX 3090 上对 Muse Glimmer 30B 模型进行了本地部署实测。结果显示,在使用 Q4KXL 量化、DFlash 以及 mmproj 的情况下,该模型可以完整支持 256k 上下文,显存占用仅约 22-23GB,表现远优于同级别的 Qwen3.6-27B 和 Gemma-4-31B。
性能数据:
- 推理速度在 64 到 124 tok/s 之间(取决于生成代码还是文本)
- Prompt 处理速度可达 1400 tok/s
相比之下,Qwen3.6-27B 在相同显存下使用 Q8 KV cache 仅能支持约 12.5 万 token,而 Muse Glimmer 的优异显存控制使其完全摆脱了对昂贵工作站(如 DGX Spark)的依赖。
「Infra」频道最新
- 微软拟量产百万级 Maia 300 芯片,受制于台积电产能 — zephyr_z9 · 2026-08-10
- RTX 5080 对决 4090:本地跑 Minimax 视频模型怎么选? — ASK_ABT_MY_USERNAME · 2026-08-10
- Qdrant 1.19 修复多租户 BM25 评分干扰 — qdrant_engine · 2026-08-10
- AI 攻防战将引爆网络安全热潮,防御需靠更多 AI — jzl86 · 2026-08-10
- Red Hat AI 推出 Muse-Glimmer 30B 的 FP8 量化版,显存占用减半 — vllm_project · 2026-08-10
- 曝微软将量产 Maia 300 芯片,计划 2027 年部署超百万片 — thoefler · 2026-08-10