受控实验:on-policy 蒸馏优势多为假象,SFT 用 1/15 算力达到同等精度

A_K_Nain · x · 2026-10-07

arXiv 论文《Rethinking Self-Distillation for Multi-Teacher Capability Merging》通过受控自蒸馏研究挑战了多教师 on-policy 蒸馏(MOPD)的主流叙事。

结论:许多所谓 on-policy 蒸馏的收益来自训练设计选择和超参优化,而非算法本身。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →