反思 On-policy 蒸馏:研究者提出 OLIVE,让学生模型学老师续写

May_F1_ · x · 2026-09-27

研究者 dylanworks 与 UPenn、UW、MIT 的合作者注意到近期 on-policy distillation 工作层出不穷,开始反思我们究竟需要它做什么、是否有更简单的替代方案。

他们正在探索一个名为 OLIVE 的思路:让学生模型先自己尝试,再从老师模型的续写(continuation)中学习,以此替代或简化传统的 on-policy 蒸馏流程。目前是项目早期探索阶段,具体实验结果尚未公布。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →