论文揭示 on-policy 蒸馏增益来自抑制低概率 token,无需教师

burny_tech · x · 2026-09-03

论文《Does On-Policy Distillation Really Distill?》(Yi Ding, Ruqi Zhang) 对 on-policy 蒸馏(OPD)的有效性来源做了定量拆解,结论出人意料:

据此作者提出无监督方法 On-Policy Self-Adaptation (OPSA):用熵自适应负优势,在高熵位置施加更强学习信号、压制尾部 token,并在头部 token 间均匀重分配概率质量。

效果:相比基座 Qwen3-1.7B,OPSA 在 AIME24 上 Avg@32 提升 35.41 分(相对提升 263%),三个基准的 Pass@32 均翻倍以上;在 AIME24 的 Avg@32 上超过 OPD 16.77 分,且跨模型家族与任务验证了泛化性。

所属事件:研究称同策略蒸馏增益源于抑制低概率 token,无需教师(4 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →