SpecFold 利用多分支冗余,扩散语言模型推测解码提速至 1.99x
GeorgiaTech · hf · 2026-10-10
佐治亚理工团队提出 SpecFold,一种算法-系统协同设计,加速扩散大语言模型(DLLM)的多分支推测解码。
- 核心发现:以往加速方法主要利用去噪步骤间的时间冗余,而 SpecFold 挖掘推测验证步骤内部的「多分支计算冗余」——草稿分支大量继承父分支 token,隐状态高度相似,存在大量可复用计算。
- 方法:算法层面做 token 级残差门控,通过折叠注意力与 FFN 选择性复用父分支计算;系统层面用 Triton 内核实现稀疏多分支执行。
- 效果:在 2 个 DLLM 家族、5 个模型、5 个基准上,吞吐较 Spiffy 最高提升 1.64x,较原生解码最高 1.99x,任务性能基本不变;与时间缓存正交,兼容现有推测策略。
「Infra」频道最新
- 德累斯顿芯片厂或走无EUV路线,浸润式多重曝光可撑7nm — pstAsiatech · 2026-10-10
- Qwen 语音双线拆解:云端可租的 Audio-3.1 与本地可跑的 TTS/ASR — lmoroney · 2026-10-10
- 三星开源 LittleBit:13B 模型极限量化压进 1GB 内存 — udmrzn · 2026-10-10
- 分析师称 agentic CPU 研究与 NVIDIA Vera 基准结论一致,关注扩展路径之争 — BenBajarin · 2026-10-10
- Container 运行时 P95 延迟降至 731ms,两周再快 180ms — ritakozlov · 2026-10-10
- 亚马逊跟进微软宣布弃用数据中心交易保密协议,社区反对已致数百项暂停令 — TechCrunch AI · 2026-10-10