北航等四校提出ASD近似投机解码:免训练即插即用,提速最高15.26%
新智元 · wechat · 2026-09-05
北京航空航天大学、清华大学、香港大学、北京大学联合团队提出近似投机解码(ASD),给投机解码「首个分歧即截断」的严格验证规则松绑。论文:arxiv.org/abs/2608.03447,代码已开源。
核心思路:
- 标准投机解码在草稿与大模型第一个 token 分歧处就停止验证,丢弃后面已算好的内容;ASD 在严格预算内有选择地接受极少数「大模型本来也几乎想选」的低遗憾分歧 token,并复用其后仍是贪心选择的连续后缀——这是提速的主要来源。
- 三道闸门控制误差:单个分歧的遗憾值门控、每块异常次数上限、贯穿整个请求的遗憾预算账本,使近似显式量化、可审计;预算归零即严格退回标准投机解码。
实验结果:
- Qwen3-14B + DSpark-14B 的 7 个任务上固定负载吞吐平均提升 7.78%(最高 11.73%),平均接受长度从 3.85 提升到 4.20;
- 同一验证器挂载 DSpark/EAGLE3/Medusa 三种草稿框架共 10 组设置全部正增益(3.05%–15.26%,平均 7.52%);
- 在 284B 参数的 DeepSeek-V4-Flash(8 张 H20)上验证端接受率提升约 10%–16%,精度波动不超过 0.30 个百分点;
- 验证器新增开销每 token 仅 0.045–0.083 毫秒,免训练、免微调、免额外大模型前向,即插即用。
论文坦承接受非贪心 token 会改变解码轨迹,并非无损优化,但自然结束解码审计显示多数任务准确率不降(GSM8K、MATH-500 上超 95% 请求轨迹变化而实测准确率未下降),主张速度与行为的取舍应显式建模、公开披露。
「Infra」频道最新
- 从第一性原理吃透 KV Cache:一份覆盖 MHA/GQA/MLA 到 PagedAttention 的技术手册 — techNmak · 2026-09-06
- 双 GB10 桌面级方案,称可跑当前最强本地模型 — jasonkneen · 2026-09-06
- Reddit 用户实测:一个节点让 MiniMax H3 在 5090 上告别 OOM — denizbuyukayak · 2026-09-06
- Agent 时代 KV cache 挤爆 HBM,容量不足拖垮有效带宽 — AccBalanced · 2026-09-06
- 分析师测算混合键合 HBM 假想市场:年超 30 亿次 D2D 应用 — zephyr_z9 · 2026-09-06
- Ollama CEO:企业 80-90% token 将由开源模型承担,仅占成本 10-20% — victor_explore · 2026-09-06