单台DGX Spark实测124B模型解码速度无损
独立测试者在单台DGX Spark上对总参数量达124B的Ling-3.0-flash模型进行了深度量化实测。数据显示,得益于MoE架构(5.1B激活参数),该模型在官方INT4量化及Q5KM等配置下,解码速度几乎无损,达到了38.7 tok/s。这一结果表明,通过正确的量化配置,单台设备已具备高效运行超百亿参数大模型的能力。
2026-08-12 ~ 2026-08-13 · 2 条相关
- Ling-3.0-flash 量化实测:MoE 架构让解码速度几乎无损 — AcanthisittaOk1699 · 2026-08-12
- 实测:单台 DGX Spark 跑 124B 模型达 38.7 tok/s — AcanthisittaOk1699 · 2026-08-13