研究:蒸馏预训练不保证 RL 后更高准确率,效果取决于模型规模

teortaxesTex · x · 2026-09-24

Base Labs 发布研究《When does distillation help reinforcement learning?》,系统性考察蒸馏对 RL 训练的预热作用。

所属事件:研究:蒸馏预训练不保证 RL 后更优,效果取决于模型规模(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →