Cal-OPD:只保留一半师生差异信号,在线蒸馏数学推理更优
nanjinguniv · hf · 2026-09-21
论文提出校准在线蒸馏(Cal-OPD)。标准在线蒸馏让学生模型学习强教师与在策略学生之间的 token 级差异,但该差异并非纯粹反映师生能力差距——其中混有教师自身的偏差;特权信息(privileged information)会放大教师侧似然偏移,使学生学到更多教师自身的偏差。Cal-OPD 通过正负特权干预估计教师自偏差区域,只保留超出该区域的差异成分作为优化信号。在数学推理基准上,仅保留约 52–65% 的原始差异信号,Cal-OPD 即在各模型规模上一致优于标准 OPD 及其变体。
「研究」频道最新
- 人机协作破解社会选择理论 30 年公开难题:核心稳定性委员会必存在 — xuanalogue · 2026-09-21
- 斯坦福与 Arc Institute 用 AI 设计出 16 个可杀耐药菌的噬菌体 — emmanuelvivier · 2026-09-21
- EvalSeal 开源:LLM 评测可信度回执,20 例边界判定 5 例翻车 — Fit_Fortune953 · 2026-09-21
- Program-as-Weights:0.6B 模型本地性能媲美 32B 提示,内存仅 1/50 — yuntiandeng · 2026-09-21
- 深度学习不确定性量化系统综述:安全关键场景的关键短板 — burkov · 2026-09-21
- PAW 新玩法:描述任务即可编译出本地可复用的 CPU 函数 — yuntiandeng · 2026-09-21