新论文:仅监督 1% 甚至 0.1% 的 token,稀疏蒸馏可匹敌全量 OPD
jiank_uiuc · x · 2026-09-23
arXiv 论文《1% of Tokens Can Be Enough: On Gradient Estimation in On-Policy Distillation》研究稀疏在策略蒸馏(OPD)中的梯度估计问题。
核心思路
- 稀疏 OPD 只对学生生成轨迹中的少量 token 施加教师监督,但即便教师指导有用,用单个采样 token 估计梯度也可能引入噪声。
- 作者在信息几何框架下做信噪分解,提出信息效率比(IER)指标:IER 越高,相对梯度估计误差越低;可用小候选集近似并用于 token 排序。
主要结果
- IER 可与现有 usefulness 选择器组合(IER-OR / IER-AND),保持采样 reverse-KL 训练目标不变。
- 数学推理任务上,0.1% token 预算即可超越全量 OPD:JustRL-Qwen3-4B → Qwen3-1.7B(thinking off,Bayes@32),AIME25 从 14.4 提到 19.4,AIME26 12.5→16.3,HMMT25 8.7→11.7,HMMT26 13.4→14.4。
- HealthBench 上每条轨迹约 1 个 token 的监督即可匹配全量 OPD。
- thinking-on 与 thinking-off 两种模式均有效;且增加 token 预算并非总是提升,甚至可能降低性能,选对 token 比堆量更重要。
论文与代码已开源。
所属事件:研究称仅监督 1% token 即可匹敌全量在策略蒸馏(7 条相关)→
「模型」频道最新
- Anthropic 发布 Claude Opus 5.5,距 Dario 呼吁「放缓前沿」仅数日 — Polymarket · 2026-09-23
- Grok 正式上车 Tesla:免提管理邮箱、日程和文件 — yunta_tsai · 2026-09-23
- Claude Code 2.1.280 发布:Opus 5.5 成默认模型,1M 上下文 — ClaudeCodeLog · 2026-09-23
- Claude Code 2.1.280 更新 114 项:默认切换 Opus 5.5,百万上下文定价 $4/$20 — ClaudeCodeLog · 2026-09-23
- Anthropic 预告:Sonnet 5.5 与 Haiku 5.5 将于数周内发布 — mikeyk · 2026-09-23
- Opus 5.5 发布:比 Opus 5 便宜 25%,一键成功率被称惊人 — bindureddy · 2026-09-23