多教师蒸馏新方法:只迁移偏移量,数学基准提升 4.11 分

LinkedIn · hf · 2026-10-09

LinkedIn 团队发布论文 Δ-MOPD,改进多教师在线策略蒸馏(MOPD)。传统做法迁移教师模型的最终策略,但会混入教师底座模型的偏好;论文发现「继承的底座拉力可能超过后训练带来的偏移」,这是阻碍端点迁移的机制。

新方法只提取每个教师「教师减底座」的 logit 偏移,重新锚定在学生模型的冻结初始化上:

结论:目标构造是多教师蒸馏中独立于教师选择之外的新设计轴。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →