新论文:仅监督 1% 甚至 0.1% 的 token,稀疏蒸馏可匹敌全量 OPD

jiank_uiuc · x · 2026-09-23

arXiv 论文《1% of Tokens Can Be Enough: On Gradient Estimation in On-Policy Distillation》研究稀疏在策略蒸馏(OPD)中的梯度估计问题。

核心思路

主要结果

论文与代码已开源。

所属事件:研究称仅监督 1% token 即可匹敌全量在策略蒸馏(7 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →