NVIDIA 发布推测解码五准则:EAGLE-3、MTP 等机制横向对比
NVIDIAAI · x · 2026-09-05
NVIDIA 技术博客《Co-Designing AI Models Using Speculative Decoding for Faster LLM Inference》系统讲解了如何用推测解码(小 draft 模型并行生成多个 token、大模型并行验证)在不损失精度的情况下加速 LLM 推理,并给出五条实用准则:
- 将 GEMM 推入 compute-bound 区域,同时避免增加 KV cache 压力
- 当注意力占主导时,draft 长度设为 128/G - 1
- 较大的 draft 长度应与注意力 kernel 的 128 tile 边界对齐
- 极低延迟场景下,只在接受率收益能覆盖 draft 开销时才加大 draft 长度
- draft 机制选择需权衡接受长度、draft 开销与训练部署成本
文章对比了外部 draft 模型、EAGLE-3、MTP、DFlash、DSpark 以及 suffix/n-gram 等机制在训练成本、服务时内存、每 token 猜测成本上的取舍;NVIDIA 还开源了自研基准 SPEED-Bench(用编码、摘要等真实任务测量接受长度),并在 NVIDIA/Model-Optimizer 仓库提供 EAGLE-3、DFlash、DSpark 的可运行训练示例,含在 Nematron 3.5 Lightning 上演示的微调与量化工作流。
所属事件:NVIDIA 发布投机解码五准则,谈模型与 GPU 协同设计(3 条相关)→
「Infra」频道最新
- Aer Lingus 一半远程机队已装上 Starlink,年内全覆盖 — elonmusk · 2026-09-05
- 开发者用 Qwen3.8-27b-mlx 在 M5 MacBook 本地跑通网页与素材生成 — walkingriver · 2026-09-05
- 开源Agent Substrate:让K8s智能体秒级挂起恢复、密度提升10倍 — davemccollough · 2026-09-05
- AI 应用横向化遇上软硬件垂直整合红利,或催生超强垄断厂商 — matt_slotnick · 2026-09-05
- 换 AWQ W4A16 量化 + vLLM 补丁后,本地 Qwen 3.8 Flash Next 基准从 91 升到 98 — WonderRico · 2026-09-05
- 曝 Coatue 拟与芯片创企 MatX 设数十亿美元合资,助其锁定 HBM 与晶圆产能 — zephyr_z9 · 2026-09-05