单卡 DGX Spark 跑 Qwen3.8 Flash 212 tok/s,作者开源完整 vLLM 配方
DimeRhyme · reddit · 2026-09-29
结果
作者在单台 DGX Spark(GB10)上给出 Qwen3.8 Flash 的 vLLM serving 配方,全部开源:
- 单流峰值 74 tok/s,常规请求 60-70(常见单卡方案仅 35-45);8 流并发达 212 tok/s。
- 冷 prefill 比原配方快 2-3.4 倍(16K 提示 4,016 vs 1,171 tok/s)。
- 支持完整 262K 上下文,缓存命中时代码提示约 0.57s 开始回复;质量与原模型在噪声范围内一致(492 题套件 93.1%/93.3%,top-1 一致性偏移 0.06 点)。
关键优化点
- 密集运行模型自带 MTP 头:每步验证猜中约 3.7 个 token,是最大提速杠杆; speculate 机制保证输出质量不变。
- 裁剪 draft 头词表:248K→65K id。GB10 上 draft 阶段受内存带宽限制,目标模型仍用全词表验证,只影响速度。
- 量化方案:MoE 专家用 W4A16 AutoRound,旁路层 FP8,lmhead INT8;刻意不用 3-bit/NVFP4,把收益留给 serving 路径。
- GB10 调优的低延迟 GEMM + verify 步骤免排序 top-k。
- 更快的逐层 embedding gather 路径,消除 prefill 中的串行 page fault。
- 每步解码从 68.3ms 降到 52.3ms。
- 失败尝试:把 prefill chunk 翻倍到 16,384 token 无收益且内存吃紧。
资源占用
模型约 71 GiB,KV pool 16 GB,负载下仍余约 16 GiB;生成时 GPU 中位功耗 35-37W。作者指出这些技巧大多适用于任何 MTP/speculative decoding 部署。
「Infra」频道最新
- 全本地训练 0.8B/2B 决策模型,2B 得分 83.1% 追平 Jev — Usual_Maximum7673 · 2026-09-29
- Reddit 热议:千元级本地跑 SOTA 模型的设备是下一个大机会 — Robert__Sinclair · 2026-09-29
- SemiAnalysis:6000 个数据中心项目仅 3 个受暂停令影响 — MatthewBerman · 2026-09-29
- Cloudflare 生日周开源大礼包:forge、vinext 1.0、Rust Workers 等 8 项更新 — ritakozlov · 2026-09-29
- 谷歌趋势美国区榜首全是怀俄明州?作者疑因数据中心机器流量 — lilyraynyc · 2026-09-29
- Sentdex:本地跑了 40 亿 token,GLM 5.3 Flash 成其最常用本地模型 — Sentdex · 2026-09-29