新研究:在线策略蒸馏只需监督 1% 的 token,0.1% 有时也够
jiank_uiuc · x · 2026-09-23
MBZUAI 与蚂蚁集团合作的新论文《1% of Tokens Can Be Enough: On Gradient Estimation in On-Policy Distillation》研究稀疏在线策略蒸馏(OPD)中的梯度估计问题。
核心发现:
- 有用的教师指导仍可能产生噪声更新,因为梯度往往只从单个采样 token 估计
- 提出信息效率比(IER)指标,基于信噪比分解衡量梯度估计可靠性
- 将 IER 与现有 token 选择的有用性分数结合,在数学与医疗推理任务上,0.1%–1% 的 token 预算即可匹配甚至超过全量 OPD
- 在思考开/关两种模式下均有效,小预算时收益尤其明显
论文与代码均已开源。
所属事件:研究称仅监督 1% token 即可匹敌全量在策略蒸馏(7 条相关)→
「模型」频道最新
- 私有评测黑箱遭吐槽:看不了样本,只能靠猜 — xeophon · 2026-09-23
- Claude Opus 5.5 评测出炉:全面领先且价格减半 — NousResearch · 2026-09-23
- Anthropic 发布 Claude Opus 5.5:比 Opus 5 便宜 40%,680K 行代码迁移一天完成 — evilrabbit_ · 2026-09-23
- Anthropic 新模型卡曝光:METR 团队进场评估「蚂蚁是否正在 fooming」 — dfrsrchtwts · 2026-09-23
- Grok 正式上车 Tesla:免提管理邮箱、日程和文件 — yunta_tsai · 2026-09-23
- Claude Code 2.1.280 发布:Opus 5.5 成默认模型,1M 上下文 — ClaudeCodeLog · 2026-09-23