蒸馏研究:KL 方向与学习率比 on-policy 更影响性能
CambUni · hf · 2026-10-03
该论文在受控的强到弱蒸馏设定下,独立变化 rollout 策略、token 级 KL 方向与学习率,覆盖 Llama3 与 Qwen2.5 两大模型家族及科学、医学、算术推理任务。
核心发现:
- rollout 策略并非决定性因素,与「on-policy 天然更好」的主流观点相悖
- token 级 KL 方向更清晰地决定任务表现与输出覆盖:forward KL 对 rollout 策略非常鲁棒,reverse KL 则显著敏感、更偏好学生自生成 rollout
- 学习率主要控制遗忘与更新稀疏性
- on-policy 数据确实提升对更难 Countdown 变体的泛化,但这一优势在后续 RLVR 后不稳定
- 结论对去除梯度裁剪、采样式 KL 估计、长推理链任务均稳健
整体结论:on-policy rollout 的价值取决于目标函数、评测设定与超参,不应默认优先。
「研究」频道最新
- AC2 方法用 Critic 评 token 块,部分 rollout 训练快过 GRPO — ZeYanjie · 2026-10-03
- KAIST 推出 World Observer:全景观察者让世界模型看视野外世界 — Scobleizer · 2026-10-03
- Ofir Press 回应 bug 基准争议:训练该行为可取,但不许刷测试集 — OfirPress · 2026-10-03
- 中科院五年规划专章布局 AI for Science,中美路线大对决 — teortaxesTex · 2026-10-03
- 自动实验室标准草案浮现,AI 驱动科研或成下一个爆发点 — Afinetheorem · 2026-10-03
- 带 agent 的论文引用更多,AI 文献检索只看标题? — rajammanabrolu · 2026-10-03