ICML 论文揭示预训练与 RL 联合 Scaling Law

_lewtun · x · 2026-08-05

Hugging Face 期刊俱乐部讨论了论文《Understanding Reasoning from Pretraining to Post-Training》。

研究人员以国际象棋为受控环境,推导出了预训练与强化学习(RL)的联合 Scaling Law:R(CRL, N, T) = f(Lpt(N, T)) + g(N, T) × log(CRL / Cref)。

核心洞察:

所属事件:ICML论文揭示预训练与RL联合缩放定律(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →