Baseten 工程师复盘:投机解码成推理优化最快战场
AI Engineer · youtube · 2026-09-20
Baseten 的 Philip Kiely 在演讲中复盘《Inference Engineering》出版以来推理工程领域的变化,核心线索是本地推理与数据中心推理的分野:本地是「先跑通,再别那么蠢」,数据中心是「先跑通,再别那么慢」;而最大的趋势是数据中心优化越来越多来自专门的训练过程,训练与推理的界限正在模糊。
他逐一讨论三大方向:
- 量化:数据中心的答案仍是 4-bit 权重而非压缩 KV cache——TurboQuant 走红后团队算了账:4-bit cache 确实让有效带宽翻倍,但额外的解码计算让 tokens/s 掉一半以上,数据中心不可接受,内存饥渴的本地机器却接近理想。
- 缓存:前沿转向 compaction——用一个学习到的 bottleneck,以固定 query 向量对完整 KV cache 做交叉注意力,一次前向产出压缩后的 keys/values。
- 投机解码:进展最快。同族小模型从来不是好 drafter;在目标模型 hidden states 上训练 drafter 好得多;随后出现的 diffusion drafter(DFlash)一次提议 8-16 个 token,生产环境中接受率比此前最佳提升超两倍;更新的 DSpark 再串联顺序 drafter;若承担存储、算力与权限成本,在真实 prompt 上持续重训 speculator 还能把接受率再抬升 20%-100%。
「Infra」频道最新
- 回顾游戏引擎与推理引擎:本质都是多用户批处理系统 — yunta_tsai · 2026-09-20
- vLLM 接入 speculative decoding 教程:生成速度可翻倍 — MaiaStudios · 2026-09-20
- Charles Frye:KV 压缩失败罕见但代价高,长上下文场景难跑分 — charles_irl · 2026-09-20
- 千分之一概率乱码:vLLM 两个 Mamba 缓存 bug 的排查实录 — AI Engineer · 2026-09-20
- 分析师称企业多付 10-20 倍云 AI 成本,本地化拐点将至 — DavidLinthicum · 2026-09-20
- 一觉醒来欠 3.6 万美元:Cloudflare 无硬性消费上限的避坑指南 — ThePeterMick · 2026-09-20