ICML 论文揭示预训练与 RL 联合 Scaling Law
_lewtun · x · 2026-08-05
Hugging Face 期刊俱乐部讨论了论文《Understanding Reasoning from Pretraining to Post-Training》。
研究人员以国际象棋为受控环境,推导出了预训练与强化学习(RL)的联合 Scaling Law:R(CRL, N, T) = f(Lpt(N, T)) + g(N, T) × log(CRL / Cref)。
核心洞察:
- 更强的预训练能让 RL 本身获得更好的扩展效果,预训练损失决定了特定 RL 预算下能达到的性能上限。
- 最优的算力分配会随规模而变化。在总预算较低时,预训练占主导;随着预算增加,计算最优分配会向 RL 倾斜,其占比从约 20% 开始逐渐上升。
所属事件:ICML论文揭示预训练与RL联合缩放定律(3 条相关)→
「研究」频道最新
- 微软开源 Orchard:面向真实环境的 Agent 训练与评测基础设施 — udmrzn · 2026-08-05
- MONET 数据集发布:1.05 亿样本助力开源文生图研究 — victormustar · 2026-08-05
- 论文速递:基于条件流匹配从噪声数据生成纯净样本 — kwangmoo_yi · 2026-08-05
- 广义Hopfield网络新论文:将记忆存储于高维曲面 — burny_tech · 2026-08-05
- Harness-R1:让智能体从失败轨迹中学习并自我打补丁 — dair_ai · 2026-08-05
- 思路探讨:能否训练 AI 模型将盗录视频画质提升至高清? — gelado1000 · 2026-08-05