双节点 DGX Spark 实测 Qwen3.8 达 181 tok/s 聚合吞吐
开发者分享了在 2 节点 NVIDIA DGX Spark(GB10)上部署 Qwen3.8-Flash-Next 的实测结果:通过 NVFP4 量化等一系列优化,实现 181 tok/s 的聚合解码吞吐量,其中解码速度约 50 tok/s,预填充吞吐达 2900 tok/s,展示了该模型在小型多节点设备上的推理潜力。
2026-08-29 ~ 2026-08-30 · 2 条相关
- 实测 Qwen3.8 在双节点 DGX 上达 181 tok/s 吞吐 — StartupTim · 2026-08-29
- 双 DGX Spark 跑 Qwen3.8-Flash-Next:解码 50t/s、预填充 2900t/s — -dysangel- · 2026-08-30