WaveFront 解码让循环语言模型提速最高 4.81 倍,无需训练
pmttyji · reddit · 2026-10-06
论文提出 WaveFront Decoding(WFD),一种免训练的自推测解码框架,专为循环(looped)语言模型设计。要点:
- 问题:循环模型通过重复施加权重共享块增加有效深度,但每个 token 需要 T 次串行递归调用,解码延迟高。
- 思路:利用两个性质——中间递归输出可作有效草稿预测;权重共享让不同位置、不同递归深度的 token 状态能合并进一次批处理递归调用。WFD 把混合深度的状态排成「对角波前」,在浅层持续起草新位置的同时推进早期位置走向全深度验证,起草与验证在同一批递归调用中并发进行。
- 结果:在 Spec-Bench 六类任务上,Ouro-2.6B 达 2.42 倍加速,Huginn-3.5B 达 3.54 倍,均超过传统 draft-then-verify;结合跨递归 KV 共享后 Huginn-3.5B 提升至 4.81 倍。
代码已开源(GitHub),论文见 arXiv:2609.23033。
「Infra」频道最新
- 谷歌购入 890 兆瓦核电:不建新堆,只给 11 座现有反应堆「提功率」 — MicahBerkley · 2026-10-06
- Cycle.io 发布 DevOps MCP:15 分钟跨三云配好 Mongo 副本集 — AlexMattoni · 2026-10-06
- Weaviate 推出查询性能剖析,47ms 慢查询定位到磁盘读取而非向量检索 — CShorten30 · 2026-10-06
- HN 热议:Oracle 触发 AI 泡沫破裂的连锁反应 — mpweiher · 2026-10-06
- Lambda 模型卡接入 NVIDIA AIPerf:实测真实负载下的推理性能基准 — TheZachMueller · 2026-10-06
- Nvidia 逼近全球首家 6 万亿美元市值公司,AI 热潮仍在延续 — AryHHAry · 2026-10-06