LastOPD 发现潜层对齐蒸馏先涨后崩,只用末层信号提分 5.5

Jie Yang · hf · 2026-09-29

作者团队在把 Qwen3-4B/8B 蒸馏到 Qwen3-1.7B-Base 时,发现基于潜层状态对齐的 on-policy 蒸馏(OPRD 类方法)存在两个反直觉的失败模式:

分析认为,按深度配对的层在师生两个模型中扮演的角色不同,持续对齐会把学生拉向它无法理解的教师状态。

LastOPD 的做法:只在最后一层状态(两个 LM head 共同读取的公共接口)施加潜层信号,并仅在 10 步的 crossfade 过渡期内使用,随后完全交给 token 级 on-policy 蒸馏,从而在崩溃发生前保留有用信号。

效果:相比纯 token 级 OPD,MATH-500 分别提升 5.55(4B 教师)和 4.02(8B 教师)分,多数 held-out 数据集领先,且用约一半步数即达到纯 token 级 OPD 的最终成绩。代码已开源。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →