Draft-OPD:用策略内蒸馏提升投机解码模型性能
auto_grad_ · x · 2026-08-25
EMNLP 2026 录用论文《Draft-OPD: On-Policy Distillation for Speculative Draft Models》解决投机解码中的训练-推理不匹配问题。传统草稿模型使用离线 SFT 在目标模型生成的轨迹上训练,但在推理时,草稿模型面对的是自己策略诱导的状态分布,导致性能饱和。论文提出的 Draft-OPD 方法利用目标模型辅助的 Rollout 进行稳定延续,并从验证暴露的错误位置重放草稿过程,使草稿模型能从接受和拒绝的提议中学习目标反馈,显著提升了接受长度和推理速度。
「Infra」频道最新
- 实测揭示 Agent 落地瓶颈:推理外开销与工具调用 — MatthewBerman · 2026-08-25
- AI 推高成本,Pine64 暂停生产 Linux 设备 — JeremyCMorgan · 2026-08-25
- VecturaKit 发布:基于 Swift 的端侧向量数据库,支持 MLX 加速 — rudrank · 2026-08-25
- OpenAI 单日申请五个商标:JALAPENO 到 SCOTCH BONNET 全是芯片 — AJChadha · 2026-08-25
- 分析师预测:TPU 出货量将于 2028 年超越英伟达 — AccBalanced · 2026-08-25
- 教程:在树莓派上运行 Hermes Agent — LeviTurk · 2026-08-25