NAVER 提出 DLoop 循环式投机解码,推理加速最高 41%

NAVER AI Lab 发布论文《DLoop: Looped Speculative Decoding》,改进投机解码的验证时机:观察到草稿模型变强后,目标模型经常一次性接受整段草稿,造成不必要的前向计算。DLoop 让草稿模型连续起草多轮后再统一验证,减少目标模型前向次数,实测推理加速提升 5% 至 41%。

2026-10-08 ~ 2026-10-09 · 2 条相关