受控实验:on-policy 蒸馏优势多为假象,SFT 用 1/15 算力达到同等精度
A_K_Nain · x · 2026-10-07
arXiv 论文《Rethinking Self-Distillation for Multi-Teacher Capability Merging》通过受控自蒸馏研究挑战了多教师 on-policy 蒸馏(MOPD)的主流叙事。
- 实验覆盖 2 个多教师设置、4 个模型、11 个 benchmark,对比 SFT、soft-label 蒸馏、teacher-prefix 蒸馏和 MOPD 四种方法
- 四种方法精度几乎相同,但 MOPD 消耗 14.8–23.1 倍于 SFT 的训练 GPU 时
- 复查四篇已发表的 on-policy vs off-policy 对比:当 SFT 基线用拒绝采样教师轨迹训练并独立调参后,on-policy 的报告优势大幅缩水
- 免训练替代方案:简单权重合并只需几分钟 CPU 时间即可恢复专家能力,但精度会随任务数量增加而退化
结论:许多所谓 on-policy 蒸馏的收益来自训练设计选择和超参优化,而非算法本身。
「研究」频道最新
- Fractal Frontier:AI 或将证明世界远比人类偏好更有序 — IgorCarron · 2026-10-07
- BVB 基准:让 Agent 用 Blender 程序化重建真实视频来检验理解力 — RexDouglass · 2026-10-07
- DeepMind 发布 AlphaProtein Novo,可从零设计全新酶催化自然界没有的反应 — Scobleizer · 2026-10-07
- 安全研究者翻出 2025 年演讲旧预测:竟提前命中 ExploitGym 及其问题 — moyix · 2026-10-07
- OpenAI 新数学仓库或夯实磁等离子体研究,候选成果瞄准 Vlasov-Maxwell 方程 — johnseach · 2026-10-07
- 数学外包给 OpenAI 后,经济学研究格局将如何重排 — RexDouglass · 2026-10-07