研究称仅监督 1% token 即可匹敌全量在策略蒸馏
MBZUAI 与蚂蚁集团等机构 9 月下旬发布 arXiv 论文《1% of Tokens Can Be Enough: On Gradient Estimation in On-Policy Distillation》(编号 arXiv:2609.24432),研究稀疏在策略蒸馏(OPD)中的梯度估计问题。作者之一 jiankuiuc 在系列帖子中介绍:稀疏 OPD 只在学生生成轨迹的一小部分 token 上施加教师监督,实验显示仅监督 1% 的 token 即可匹敌全量 OPD,某些情况下 0.1% 也足够,甚至可超越全量监督。
已确认
- 论文由 MBZUAI 与蚂蚁集团等合作发布,UIUC 相关作者团队(jiankuiuc 等)参与并自行在社交平台连续介绍。
- 核心发现:教师指导本身有用,但基于单 token 采样的梯度估计噪声很大,是蒸馏效率的瓶颈之一。
- 作者从信息几何视角拆解了噪声来源:蒸馏的期望梯度需对可能的下一个 token 求平均,而实践中往往只用一个采样 token 估计,导致高方差更新。
- 论文提出信息效率比 IER(Information Efficiency Ratio)等度量来刻画监督 token 数与性能的关系。
为什么重要
- 若只需监督 0.1%–1% 的 token 即可保持蒸馏效果,训练时的教师前向/评分开销可大幅降低,蒸馏成本显著下降。
- 该结果为“更多监督 token 不一定更好”提供了梯度估计层面的理论解释,对大规模模型的在策略蒸馏流程设计有直接参考价值。
2026-09-22 ~ 2026-09-23 · 7 条相关
一手来源
- 新论文:仅监督 1% 甚至 0.1% 的 token,稀疏蒸馏可匹敌全量 OPD — jiank_uiuc ·
- 拆解蒸馏噪声来源:单 token 采样的梯度估计为何不可靠 — jiank_uiuc ·
- MBZUAI×蚂蚁论文:1% token 的稀疏蒸馏即可匹敌全量 OPD — jiank_uiuc ·
- 蚂蚁等新研究:仅监督 1% token 可匹敌全量在线蒸馏 — jiank_uiuc · 2026-09-22
- 【源头】新论文:仅监督 1% 甚至 0.1% 的 token,稀疏蒸馏可匹敌全量 OPD — jiank_uiuc · 2026-09-23
- 【源头】拆解蒸馏噪声来源:单 token 采样的梯度估计为何不可靠 — jiank_uiuc · 2026-09-23
- 【源头】MBZUAI×蚂蚁论文:1% token 的稀疏蒸馏即可匹敌全量 OPD — jiank_uiuc · 2026-09-23
另有 3 条近重复转述:jiank_uiuc · jiank_uiuc · jiank_uiuc