论文揭示 on-policy 蒸馏增益来自抑制低概率 token,无需教师
burny_tech · x · 2026-09-03
论文《Does On-Policy Distillation Really Distill?》(Yi Ding, Ruqi Zhang) 对 on-policy 蒸馏(OPD)的有效性来源做了定量拆解,结论出人意料:
- 教师信号噪音很大:教师给学生自身生成的轨迹打分,本身是 off-policy 的,监督信号含大量噪声,且教师规模越大噪声越多。
- 学生对噪声不敏感:保留或去掉噪声监督,最终性能几乎一样——教师基本上没“蒸馏”什么东西。
- 增益真正来源:学习集中在低对数概率 token 上,用单一的固定负优势替代教师打分,性能完全相当。即 OPD 主要是压制低概率尾部 token。
据此作者提出无监督方法 On-Policy Self-Adaptation (OPSA):用熵自适应负优势,在高熵位置施加更强学习信号、压制尾部 token,并在头部 token 间均匀重分配概率质量。
效果:相比基座 Qwen3-1.7B,OPSA 在 AIME24 上 Avg@32 提升 35.41 分(相对提升 263%),三个基准的 Pass@32 均翻倍以上;在 AIME24 的 Avg@32 上超过 OPD 16.77 分,且跨模型家族与任务验证了泛化性。
所属事件:研究称同策略蒸馏增益源于抑制低概率 token,无需教师(4 条相关)→
「研究」频道最新
- ICLR 2027 去匿名化政策获赞,有学者呼吁投稿上限再砍到 5 篇 — peter_richtarik · 2026-09-03
- motion-bricks.cpp 开源:桌面 CPU 实时生成关键帧动画 — zhengyiluo · 2026-09-03
- Mostik 潜空间桥接大小模型:登顶 ARC-AGI 3,成本降至 1/20 — SimplyAnnisa · 2026-09-03
- 机制设计或成对齐新思路:不改神经网络,改游戏规则 — morqon · 2026-09-03
- Chris Potts 在 IPAM 可解释性工作坊讲解新论文 — ChrisGPotts · 2026-09-03
- 研究提出离散扩散视角的循环 Transformer,绕过递归反传 — SkyLi0n · 2026-09-03