新论文:只监督 0.1%-1% 的 token 就能匹敌全量策略蒸馏

jiank_uiuc · x · 2026-09-23

论文《1% of Tokens Can Be Enough: On Gradient Estimation in On-Policy Distillation》研究在线策略蒸馏(OPD)中的梯度估计。核心发现:教师指导虽有用,但产生的更新噪声大;作者提出信息效率比(Information-Efficiency Ratio, IER)来衡量梯度估计的可靠性,并结合有用性评分筛选,在仅 0.1%-1% 的 token 预算下即可匹配甚至超过全量 OPD。论文与代码均已开源。

所属事件:研究称仅监督 1% token 即可匹敌全量在策略蒸馏(7 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →