Draft-OPD:用策略内蒸馏提升投机解码模型性能

auto_grad_ · x · 2026-08-25

EMNLP 2026 录用论文《Draft-OPD: On-Policy Distillation for Speculative Draft Models》解决投机解码中的训练-推理不匹配问题。传统草稿模型使用离线 SFT 在目标模型生成的轨迹上训练,但在推理时,草稿模型面对的是自己策略诱导的状态分布,导致性能饱和。论文提出的 Draft-OPD 方法利用目标模型辅助的 Rollout 进行稳定延续,并从验证暴露的错误位置重放草稿过程,使草稿模型能从接受和拒绝的提议中学习目标反馈,显著提升了接受长度和推理速度。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →