HF 期刊俱乐部:预训练与 RL 联合扩展定律揭示推理机制

_lewtun · x · 2026-08-05

Hugging Face 期刊俱乐部讨论了一项关于推理模型训练机制的新研究。该论文以国际象棋为受控环境,全面测试了从 5M 到 1B 参数的模型,推导出了预训练与强化学习(RL)的联合扩展定律。

研究发现,RL 并非单纯锐化监督微调(SFT)的策略:在简单任务上,它会放大模型已偏好的正确动作;而在困难任务上,它能激发出 SFT 阶段几乎不存在的正确解法。此外,更长时间的预训练能让模型在 RL 阶段达到更高性能且提升更快,这一规律在数学领域同样适用。

所属事件:ICML论文揭示预训练与RL联合缩放定律(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →