多教师蒸馏新方法:只迁移偏移量,数学基准提升 4.11 分
LinkedIn · hf · 2026-10-09
LinkedIn 团队发布论文 Δ-MOPD,改进多教师在线策略蒸馏(MOPD)。传统做法迁移教师模型的最终策略,但会混入教师底座模型的偏好;论文发现「继承的底座拉力可能超过后训练带来的偏移」,这是阻碍端点迁移的机制。
新方法只提取每个教师「教师减底座」的 logit 偏移,重新锚定在学生模型的冻结初始化上:
- 三教师组合时比端点组合高 4.11 分(Math) 和 1.95 分(五基准均值)
- 阶段化路由下将训练顺序带来的性能差距从 10.50 降到 6.42 分
- 交错路由(每次更新一个教师)下两者表现相当
结论:目标构造是多教师蒸馏中独立于教师选择之外的新设计轴。
「研究」频道最新
- Gemma 结合植物基因组模型 BOTANIC-1 定位甜瓜关键突变 — sachinmaya1980 · 2026-10-09
- 三周刷完斯坦福AA203全部19讲:最优控制到PPO的深度复盘 — le_james94 · 2026-10-09
- 用模型规划会主动找出模型最讨喜的错误 — le_james94 · 2026-10-09
- 一行推导看穿 REINFORCE:策略梯度即奖励加权似然 — le_james94 · 2026-10-09
- 610 例 agent reward hacking 人工标注:多数无明显环境问题 — cephaloform · 2026-10-09
- n=12 立方体堆积纪录刷新至 2.9315,AI 方法击败前纪录 — CatAstro_Piyush · 2026-10-09