双 DGX Spark 跑 Qwen3.8-Flash-Next:解码 50t/s、预填充 2900t/s

-dysangel- · reddit · 2026-08-30

Reddit 用户 -dysangel- 分享在 2× NVIDIA DGX Spark(GB10) 上以 NVFP4 量化跑 Qwen3.8-Flash-Next 的完整配置,实测 TP2 下解码 49.7 t/s(结构化输出)/ 34.8 t/s(散文),11k tokens 预填充约 2,875 t/s,单机约 35 t/s。

技术栈要点:

踩坑清单(dead ends):

作者认为剩余优化方向是 block-diffusion drafting(DFlash/DSpark)与将解码分离到大带宽 Mac;MTP 接受率结构化输出约 3.8 token/step,散文明显更低,建议两种负载都跑分。

所属事件:双节点 DGX Spark 实测 Qwen3.8 达 181 tok/s 聚合吞吐(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →