Google 生产环境用的推测解码:让 LLM 推理提速 2-3 倍
hongyangzh · x · 2026-09-13
一篇技术长文详解推测解码(speculative decoding)——Google 在 Search 的 AI Overviews、Anthropic 和 Meta 都在使用的推理加速技术,可将 LLM 推理提速 2-3 倍。
核心原理:
- 自回归解码下,目标模型每次前向传播只产出一个 token,低 batch size 时过程受内存带宽限制,GPU 大量算力闲置
- 用一个更便宜的 draft 模型一次提议多个未来 token,目标模型只需一次前向传播即可整块验证(类似 prefill)
- 若 drafter 提议 5 个 token 全部通过验证,还可从同一验证轮次额外获得 1 个奖励 token;若第 4 个 token 出错,前 3 个仍被保留
文章覆盖了内部机制、代码实现与 tradeoff,并讨论了正在取代双模型方案的新方法。
「Infra」频道最新
- xAI孟买数据中心自备电源,为冲击千亿美元ARR铺路 — PaulYacoubian · 2026-09-13
- DeepSeek 发布 V4.1-Flash KV 缓存压缩法,大幅降低推理内存成本 — justlikemedics · 2026-09-13
- 谷歌斥 151 亿美元建芬兰 AI 基础设施,含三个数据中心与核电协议 — Beth_Kindig · 2026-09-13
- 端侧模型推荐:LFM2.5-2.6B 与 MiniCPM5-2B 获开发者青睐 — reach_vb · 2026-09-13
- 提示缓存反烧钱:无人读取的缓存写入溢价正悄悄抬高你的 LLM 账单 — gethackteam · 2026-09-13
- TRL v1.13 发布:单节点 8 卡 H100 可训练超 100 万 token 序列 — SergioPaniego · 2026-09-13