为何研究实验室多用离线策略蒸馏来优化模型?

miifanboy · reddit · 2026-08-28

作者观察到 empero-ai 将 Qwen3.8 2.4T A95B 蒸馏到旧版 Qwen3.5 时使用了 Off-Policy Distillation(离线策略蒸馏),感到疑惑。作者认为,既然资源充足,使用 On-Policy Distillation(在线策略蒸馏)效果应该更好,因为它能让实际 KL 散度更好地匹配教师模型,真正蒸馏知识而非仅仅克隆行为。作者认为即使是使用 Qwen3.8 27B 进行 On-Policy 蒸馏也会优于当前方案。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →