单条查询训数百步仍持续提升,One-Shot OPD 复现全数据蒸馏大部分收益

ParshinShojaee · x · 2026-09-04

团队在发布 Rethinking OPD 后继续深入研究 On-Policy Distillation 的机制,提出 One-Shot OPD:只用一条查询就能让学生模型在数百步训练中持续改进,并恢复全数据 OPD 的大部分收益。

他们的解释是 OPD 处于「数据过饱、算法饥饿」状态:

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →