UIUC 新研究:仅监督 0.1% token 蒸馏即可超越全量 OPD
jiank_uiuc · x · 2026-09-23
作者团队(jiankuiuc 等)发布论文《1% of Tokens Can Be Enough: On Gradient Estimation in On-Policy Distillation》,提出信息效率比 IER(Information-Efficiency Ratio)来衡量在线蒸馏中梯度估计的可靠性。
核心洞察:蒸馏梯度期望是对所有可能的下一 token 平均,但实践中只用一个采样 token 估计,导致即使教师指导有用、更新仍然充满噪声。IER 从信息几何的信号-噪声分解出发定义,值越高代表相对梯度估计误差越低,可用小候选集近似并据此排序 token。
关键结果:
- 用 JustRL-Qwen3-4B 蒸馏 Qwen3-1.7B(thinking off),仅 0.1% 监督 token 即超越全量 OPD:AIME25 14.4→19.4,AIME26 12.5→16.3,HMMT25 8.7→11.7,HMMT26 13.4→14.4
- HealthBench 上约每条轨迹 1 个 token 即可匹配全量 OPD 性能
- IER 与 thinking-on/off 模式兼容,小 token 预算下收益尤其明显
- 预算扫描显示更多监督 token 未必更好,有时甚至降低性能
方法上还提出 IER-OR/IER-AND 两种方式与现有 usefulness 选择器结合,训练目标(采样 reverse-KL)保持不变。
所属事件:研究称仅监督 1% token 即可匹敌全量在策略蒸馏(7 条相关)→
「研究」频道最新
- LLM 持续学习方法 iSDFT 开源:500+ 实验平衡可塑性与稳定性 — hbouammar · 2026-09-23
- 多项式 Freiman-Ruzsa 定理留下算法难题:如何高效找到子空间 — gautamcgoel · 2026-09-23
- 研究员论证:堆并行 agent 是弱路径,RSI 需要更强 agent — gleech · 2026-09-23
- Courtade–Kumar 猜想获证明:信息论经典问题给出多比特扩展 — abeirami · 2026-09-23
- TimePre 论文登 TMLR:可逆归一化稳住概率时序预测的多假设学习 — _vztu · 2026-09-23
- Agent评测缺的不是榜单 而是可复现的轨迹与日志 — seanwbren · 2026-09-23