MBZUAI×蚂蚁论文:1% token 的稀疏蒸馏即可匹敌全量 OPD
jiank_uiuc · x · 2026-09-23
MBZUAI 与蚂蚁集团合作论文(arXiv:2609.24432)研究在线策略蒸馏(OPD)中的梯度估计问题:
- 问题:稀疏 OPD 只在学生生成轨迹的一小部分 token 上施加教师监督,但基于采样下一 token 估计的梯度噪声大,有用指导可能变成噪声更新。
- 方法:在信息几何框架下分析固定前缀处的估计问题,提出基于信噪分解的信息效率比(IER),可刻画最优标量基线下的相对梯度估计误差;通过候选集近似实现基于 IER 的 token 选择,并可与现有有用性分数组合,同时保留采样 reverse-KL 训练目标。
- 结果:在数学与医学推理任务上,加入 IER 在多种设置下改进现有选择器;0.1%1% 的 token 预算下,稀疏配置可匹敌甚至超过不做 token 选择的完整 OPD。thinking-on 与 thinking-off 两种模式均有效。
- 论文与代码均已公开。
所属事件:研究称仅监督 1% token 即可匹敌全量在策略蒸馏(7 条相关)→
「研究」频道最新
- LLM 持续学习方法 iSDFT 开源:500+ 实验平衡可塑性与稳定性 — hbouammar · 2026-09-23
- 多项式 Freiman-Ruzsa 定理留下算法难题:如何高效找到子空间 — gautamcgoel · 2026-09-23
- 研究员论证:堆并行 agent 是弱路径,RSI 需要更强 agent — gleech · 2026-09-23
- Courtade–Kumar 猜想获证明:信息论经典问题给出多比特扩展 — abeirami · 2026-09-23
- TimePre 论文登 TMLR:可逆归一化稳住概率时序预测的多假设学习 — _vztu · 2026-09-23
- Agent评测缺的不是榜单 而是可复现的轨迹与日志 — seanwbren · 2026-09-23