HF 期刊俱乐部:预训练与 RL 联合扩展定律揭示推理机制
_lewtun · x · 2026-08-05
Hugging Face 期刊俱乐部讨论了一项关于推理模型训练机制的新研究。该论文以国际象棋为受控环境,全面测试了从 5M 到 1B 参数的模型,推导出了预训练与强化学习(RL)的联合扩展定律。
研究发现,RL 并非单纯锐化监督微调(SFT)的策略:在简单任务上,它会放大模型已偏好的正确动作;而在困难任务上,它能激发出 SFT 阶段几乎不存在的正确解法。此外,更长时间的预训练能让模型在 RL 阶段达到更高性能且提升更快,这一规律在数学领域同样适用。
所属事件:ICML论文揭示预训练与RL联合缩放定律(3 条相关)→
「研究」频道最新
- 微软开源 Orchard:面向真实环境的 Agent 训练与评测基础设施 — udmrzn · 2026-08-05
- MONET 数据集发布:1.05 亿样本助力开源文生图研究 — victormustar · 2026-08-05
- 论文速递:基于条件流匹配从噪声数据生成纯净样本 — kwangmoo_yi · 2026-08-05
- 广义Hopfield网络新论文:将记忆存储于高维曲面 — burny_tech · 2026-08-05
- Harness-R1:让智能体从失败轨迹中学习并自我打补丁 — dair_ai · 2026-08-05
- 思路探讨:能否训练 AI 模型将盗录视频画质提升至高清? — gelado1000 · 2026-08-05