裁剪 MTP 草稿词表至 47k,DGX Spark 上解码提速 21.5%
MaziyarPanahi · x · 2026-09-10
Javier 分享了在单台 NVIDIA DGX Spark 上优化 Qwen3.8-Flash-Next(NVFP4 量化)推理的实战:把 MTP 投机解码的草稿词表从 248k 行裁剪到 4.7 万行的代码专用词表,草稿头显存从 1.18 GiB 降到 0.22 GiB,每步投机解码跳过约 2.9 GiB 的工作量。结果是单流代码解码从 50.6 提升到 61.5 tok/s(+21.5%),散文 +14.4%;平均单流提速约 18%,且提速随并发增加而衰减(8 流时代码 +9.0%),8 流聚合吞吐达 252 tok/s。一条「买一次硬件,靠社区调优持续变快」的典型案例。
「Infra」频道最新
- Keras 推出 ZeroModels:100+ 模型族纯 Keras 3 跨后端运行 — fchollet · 2026-09-10
- Cohere 迁移 Blackwell,多项负载 token 成本与延迟降 30–50% — cohere · 2026-09-10
- 作者用本地 AI 模型免费审校书稿,连无聊段落都揪出来 — walkingriver · 2026-09-10
- 分析:华为将推更便宜、专为国产模型调优的 AI 芯片 — 2C_ornot2C · 2026-09-10
- Photon 2.2 发布:优化 Ampere 到 Blackwell 全系 GPU 本地推理 — JFPuget · 2026-09-10
- 算完账:用前沿 AI API 标注一场足球赛要花 5000 多美元 — bittingthembits · 2026-09-10