单卡极限跑Muse Glimmer等大模型:长上下文与高TPS实测
近期,开发者社区展示了在单张消费级显卡上极限部署和优化大语言模型的惊人结果,核心焦点在于通过DFlash、NVFP4及特定量化技术大幅提升推理速度并突破显存长上下文限制。
已确认
- 高推理速度:多位开发者实测 Meta Muse Glimmer 30B 模型在单张 RTX 5090 显卡上具有极高的生成速度。@Scobleizer 报告平均速度达 208 tps,最高 274 tps;@NVIDIAAI 和 @BanghuaZ 指出在 SGLang 框架下开启 NVFP4 和 DFlash 优化,速度约为 230 tok/s。@tokenbender 和 @dejavucoder 则通过 tuned quants 和 dflash 技术,让该模型达到了 114 tokens/s 的推理速度,并认为优化后有望在 16G 显存中运行。
- 长上下文极限:@coder543 在单张 RTX 3090(24GB)上使用 Q4KXL 量化、DFlash 及 mmproj,成功让 Muse Glimmer 30B 模型完整支持 256k 上下文,显存占用仅约 22GB。@ydnar 也分享了在 RTX 3090 上部署该模型的具体配置与显存权衡。此外,@Anbeeld 报告了一项更极端的测试:在单张 RTX 3090 上为占用约 17GB 显存的 Qwen 3.5 35B A3B 模型加载了近 100 万 token 的上下文。
为什么重要
- 降低本地部署门槛:这些实测表明,结合最新的量化与底层优化技术,原本需要昂贵算力的高参数模型(如30B级别)及其超长上下文能力,已经能够浓缩进单张主流消费级显卡中流畅运行。这不仅极大降低了个人开发者的研究与应用门槛,也为大模型的本地化、隐私化部署提供了切实可行的路径。
2026-08-10 ~ 2026-08-11 · 8 条相关
- 第 1 集:Meta发布30B开源端侧模型Muse Glimmer(2026-08-10,48 条)
- 第 2 集:Meta将开源30B参数Muse Glimmer及Muse Spark 1.2(2026-08-10,4 条)
- 第 3 集:Meta发布Muse Glimmer:实测展现自主部署与优化能力(2026-08-10,6 条)
- 第 4 集:单卡极限跑Muse Glimmer等大模型:长上下文与高TPS实测(2026-08-10,8 条)
- 第 5 集:llama.cpp首发支持Meta新模型Muse Glimmer(2026-08-10,2 条)
- 第 6 集:Meta新模型Muse Glimmer 30B获Llama.cpp零日支持并成功本地跑通(2026-08-10,2 条)
一手来源
- 单卡跑满 256k 上下文:实测 Muse Glimmer 30B 本地部署显存与性能 — coder543 ·
- SGLang 首发支持 Meta 新模型 Muse Glimmer,单卡吞吐量达 230 tok/s — NVIDIAAI ·
- 单张RTX 3090跑百万token上下文:KVarN量化突破极限 — Anbeeld ·
- 【源头】单张RTX 3090跑百万token上下文:KVarN量化突破极限 — Anbeeld · 2026-08-10
- 实测 30B 模型跑出 114 tps,优化后有望在 16G 显存运行 — tokenbender · 2026-08-10
- 【源头】SGLang 首发支持 Meta 新模型 Muse Glimmer,单卡吞吐量达 230 tok/s — NVIDIAAI · 2026-08-10
- 【源头】单卡跑满 256k 上下文:实测 Muse Glimmer 30B 本地部署显存与性能 — coder543 · 2026-08-10
- 30B 模型跑出 114 TPS:开发者实测量化与切片技术 — dejavucoder · 2026-08-10
- Muse Glimmer 模型本地运行实测:单卡 RTX 5090 达 230 tok/s — BanghuaZ · 2026-08-11
- RTX 3090 部署 30B 模型实战:显存与量化级别的极限权衡 — ydnar · 2026-08-11
- 单卡 RTX 5090 跑 274 tps,实测 Meta 新模型 Muse Glimmer — Scobleizer · 2026-08-11