裁剪 MTP 草稿词表至 47k,DGX Spark 上解码提速 21.5%

MaziyarPanahi · x · 2026-09-10

Javier 分享了在单台 NVIDIA DGX Spark 上优化 Qwen3.8-Flash-Next(NVFP4 量化)推理的实战:把 MTP 投机解码的草稿词表从 248k 行裁剪到 4.7 万行的代码专用词表,草稿头显存从 1.18 GiB 降到 0.22 GiB,每步投机解码跳过约 2.9 GiB 的工作量。结果是单流代码解码从 50.6 提升到 61.5 tok/s(+21.5%),散文 +14.4%;平均单流提速约 18%,且提速随并发增加而衰减(8 流时代码 +9.0%),8 流聚合吞吐达 252 tok/s。一条「买一次硬件,靠社区调优持续变快」的典型案例。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →