反思 On-policy 蒸馏:研究者提出 OLIVE,让学生模型学老师续写
May_F1_ · x · 2026-09-27
研究者 dylanworks 与 UPenn、UW、MIT 的合作者注意到近期 on-policy distillation 工作层出不穷,开始反思我们究竟需要它做什么、是否有更简单的替代方案。
他们正在探索一个名为 OLIVE 的思路:让学生模型先自己尝试,再从老师模型的续写(continuation)中学习,以此替代或简化传统的 on-policy 蒸馏流程。目前是项目早期探索阶段,具体实验结果尚未公布。
「研究」频道最新
- AI 评审同行论文引争议,研究者集齐 7 篇关键论文回击 — sethlazar · 2026-09-27
- Rufus-Air 论文:按奖励可靠性排序 post-training 阶段炼出开源模型 — burny_tech · 2026-09-27
- 教 LLM 判断定理有趣度,AI 自主数学发现效率提升 4.3 倍 — burny_tech · 2026-09-27
- DeepMind 发布 AGI 经济政策框架:评估 11 种干预措施 — CurieuxExplorer · 2026-09-27
- Contrastive World Models:不用像素预测、纯潜空间学世界模型 — burny_tech · 2026-09-27
- CoRL 2026「持续自我改进机器人」研讨会征稿,9 月 28 日截稿 — PeterStone_TX · 2026-09-27