新论文:只监督 0.1%-1% 的 token 就能匹敌全量策略蒸馏
jiank_uiuc · x · 2026-09-23
论文《1% of Tokens Can Be Enough: On Gradient Estimation in On-Policy Distillation》研究在线策略蒸馏(OPD)中的梯度估计。核心发现:教师指导虽有用,但产生的更新噪声大;作者提出信息效率比(Information-Efficiency Ratio, IER)来衡量梯度估计的可靠性,并结合有用性评分筛选,在仅 0.1%-1% 的 token 预算下即可匹配甚至超过全量 OPD。论文与代码均已开源。
所属事件:研究称仅监督 1% token 即可匹敌全量在策略蒸馏(7 条相关)→
「研究」频道最新
- LLM 持续学习方法 iSDFT 开源:500+ 实验平衡可塑性与稳定性 — hbouammar · 2026-09-23
- 多项式 Freiman-Ruzsa 定理留下算法难题:如何高效找到子空间 — gautamcgoel · 2026-09-23
- 研究员论证:堆并行 agent 是弱路径,RSI 需要更强 agent — gleech · 2026-09-23
- Courtade–Kumar 猜想获证明:信息论经典问题给出多比特扩展 — abeirami · 2026-09-23
- TimePre 论文登 TMLR:可逆归一化稳住概率时序预测的多假设学习 — _vztu · 2026-09-23
- Agent评测缺的不是榜单 而是可复现的轨迹与日志 — seanwbren · 2026-09-23