英伟达官方推理指南:投机解码方案几乎全由华人团队主导
新智元 · wechat · 2026-09-03
英伟达技术博客发布《用投机解码做 AI 模型协同设计》长文,以一张选型表盘点 6 种主流推理加速方案的训练成本与适用场景,罕见地以芯片厂商官方姿态把「模型贴着硬件极限设计」写成规范,入选方案几乎全由华人团队主导。
文中拆解了投机解码的加速比公式(Speedup = L×Ttarget/(Tdraft+Tverify)),并梳理技术演进主线:
- 外置草稿模型:从头训练需 1T-10T token,英伟达为其安排的归宿是 200 亿美元收购的 Groq LPU;
- EAGLE-3:北大与滑铁卢团队三年连发三代,曾被挤到「参考位」,接受长度已被后浪超越;
- MTP(多 Token 预测):Meta 首创、DeepSeek-V3 锤成标配,被英伟达评为 GPU 上大模型的最佳选择;
- DFlash:借鉴扩散模型一次前向并行生成 7 个 Token 预测,实现 6 倍无损加速;
- DSpark:DeepSeek 与北大 24 人混编团队在并行底座外挂轻量串行模块,接受长度比 EAGLE-3 高近 30%、比 DFlash 高 18%,在 DeepSeek-V4 线上生产环境比 MTP 快 60%-85%。
文章核心结论是硬件常数反向锁死模型架构:由 GPU Tile Size(128)推导出 D=128/G−1,注意力分组数 G 直接决定草稿长度(G=8 猜 15 个、G=32 猜 3 个)。推理效率竞赛的重心已从堆参数转向吃透硅片物理极限。
「Infra」频道最新
- 5090 货架首次堆货:Microcenter 缺货潮或现缓解迹象 — OvertaxedOne · 2026-09-03
- JapanFold 免费开放 8 个生物 AI 模型,推理栈与 LLM 截然不同 — DavidBennett__ · 2026-09-03
- RX 6700 XT 上压榨 Qwen 35B:llama.cpp 百k 上下文调优实录 — Loose_Doubt367 · 2026-09-03
- 开源实验:用 DLSS 5 在游戏引擎外做视频神经渲染播放器 — 2600th · 2026-09-03
- Magnitude 开源推理服务器:本地模型直接接入你现有的编码 Agent — magnitudedev · 2026-09-03
- Extropic 热力学芯片详解:赌的不是便宜随机数而是新型计算范式 — rosemaryoannah · 2026-09-03