Cal-OPD:只保留一半师生差异信号,在线蒸馏数学推理更优

nanjinguniv · hf · 2026-09-21

论文提出校准在线蒸馏(Cal-OPD)。标准在线蒸馏让学生模型学习强教师与在策略学生之间的 token 级差异,但该差异并非纯粹反映师生能力差距——其中混有教师自身的偏差;特权信息(privileged information)会放大教师侧似然偏移,使学生学到更多教师自身的偏差。Cal-OPD 通过正负特权干预估计教师自偏差区域,只保留超出该区域的差异成分作为优化信号。在数学推理基准上,仅保留约 52–65% 的原始差异信号,Cal-OPD 即在各模型规模上一致优于标准 OPD 及其变体。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →