蒸馏起点对 RL 后性能有多大帮助?跨模型规模实证研究

lateinteraction · x · 2026-09-24

baselabs 团队探讨了一个常被忽视的问题:蒸馏(让较弱模型先从更强模型学习)是 RL 训练前的常见准备步骤,但更好的蒸馏起点在 RL 训练之后到底带来多大收益?研究者在不同模型规模和多种推理任务上做了初步实验,考察蒸馏起点质量与 RL 最终效果的关系。

所属事件:研究:蒸馏预训练不保证 RL 后更优,效果取决于模型规模(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →