研究发现在线蒸馏可弃用 KL 散度,仅少数分歧 token 方向即足够
Wenze Lin · hf · 2026-09-30
- 核心发现:在线蒸馏(OPD)中 KL 散度并非必需——只要更新方向朝向教师模型即可有效训练;且关键的不是每个 token 的方向,而是师生分歧最大的少数 token 的方向,只要它们朝向教师,其余 token 即使被拉离也无碍。
- 简化损失:对教师概率高于学生的 token 赋 +1、低于则赋 -1 的简单奖励,即可复现 reverse KL 版 OPD 几乎相同的训练行为。
- 应用 C-MOPD:改进多教师蒸馏 MOPD——不再把每个样本路由给单一教师(易造成跨域能力冲突),而让每个样本接受所有教师监督;在数学与代码基准上持续超越 MOPD。
- 代码开源:github.com/LeapLabTHU/KL-Free-OPD。
「研究」频道最新
- 新论文提出 DepthBench:残差连接设计决定模型有效计算深度上限 — teortaxesTex · 2026-09-30
- Xcelsa AI 修芯片时序违例:3 小时搞定通常需一个月的活 — IanAndrewsDC · 2026-09-30
- Fatima Fellowship 春季超700人申请,秋季批次开放报名 — deliprao · 2026-09-30
- flyverse 开源框架:把完整果蝇连接组放进可扩展模拟环境 — repligate · 2026-09-30
- littmath:模型写得好之后,人类写作将只为帮自己想清楚问题 — littmath · 2026-09-30
- SOSP 2026 日本高校论文为零,AI 时代系统研究如何破局 — tianyin_xu · 2026-09-30