清华研究:单条样本也能做 On-Policy 蒸馏,追平 17000 题效果

jiqizhixin · x · 2026-09-24

清华大学发布论文《Rethinking On-Policy Distillation II: One Training Example》,做了一个极端实验:把 On-Policy Distillation(OPD)的训练集从 17000 道题压缩到仅 1 道,观察效果极限。

研究指出,现有工作多聚焦训练目标、优化方式和师生关系,而训练数据的规模与构成对 OPD 的影响此前鲜有探索。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →