蒸馏研究:KL 方向与学习率比 on-policy 更影响性能

CambUni · hf · 2026-10-03

该论文在受控的强到弱蒸馏设定下,独立变化 rollout 策略、token 级 KL 方向与学习率,覆盖 Llama3 与 Qwen2.5 两大模型家族及科学、医学、算术推理任务。

核心发现:

整体结论:on-policy rollout 的价值取决于目标函数、评测设定与超参,不应默认优先。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →