研究:蒸馏预训练不保证 RL 后更优,效果取决于模型规模

baselabs 团队发布研究《When does distillation help reinforcement learning?》,系统考察蒸馏作为 RL 训练预热步骤的实际价值这一常被忽视的问题。研究者在不同模型规模上实验发现,更好的蒸馏起点并不保证 RL 训练后的更高准确率,蒸馏对 RL 的帮助程度取决于模型规模,为业界训练流程提供了实证参考。

2026-09-24 ~ 2026-09-24 · 2 条相关