Ling-3.0-flash 量化实测:MoE 架构让解码速度几乎无损
AcanthisittaOk1699 · reddit · 2026-08-12
社区开发者分享了 Ling-3.0-flash(124B 总参数,5.1B 激活参数)在单台 DGX Spark 上的量化阶梯实测数据。
- 速度表现:在 Q5KM 到 Q6K 的量化阶梯中,单流解码速度均保持在 32 到 40 tok/s 之间。其中 Q5KM 速度最快(40.2 tok/s)且接近无损。
- MoE 优势:由于该模型每次推理仅激活极少参数,降低量化位宽几乎没有折损解码速度。这与传统密集模型(Dense Model)通过降低位宽换取吞吐量的情况截然不同。
- 横向对比:作为参考,在同一硬件上,DeepSeek V4 Flash 的速度为 16.5 tok/s,这意味着 Q5 版本的 Ling-3.0-flash 速度约为其 2.4 倍。
「Infra」频道最新
- 单文件98GB跑DeepSeek V4 Flash:AMD端侧推理实测破32 tok/s — tensorqt · 2026-08-12
- NVIDIA 发布在 DGX Station 本地运行 Nemotron 3 Ultra 教程 — NVIDIAAI · 2026-08-12
- Phosphene 大版本更新:Mac 跑 MiniMax H3 内存大降,10秒直出 — cocktailpeanut · 2026-08-12
- 图解大模型推理:Prefill 与 Decode 两阶段如何影响速度 — techNmak · 2026-08-12
- RX 7600 XT 16GB 本地跑 30B 模型实测:结合投机解码达 20 t/s — DanC403 · 2026-08-12
- vLLM 首发 Day-0 支持 NVIDIA Nemotron 3.5 Lightning — AccBalanced · 2026-08-12