研究发现:预训练损失可预测 RL 放大趋势
heghbalz · x · 2026-07-21
预训练损失可在非饱和区预测 RL 放大效应
这条线程给出的核心结论是:在非饱和区间,预训练损失可以预测固定 RL 计算量下的 post-RL pass@1。
- 作者拟合出一个局部对数线性规律。
- 奖励斜率与预训练 token 的对数近似线性增长。
- 附图展示了预训练指标与 RL 奖励斜率之间很强的相关性。
所属事件:新研究提出预训练与RL联合缩放律(18 条相关)→
「研究」频道最新
- Michael Levin 发布 Platonic Space 论文同行评审版及实验室资源 — drmichaellevin · 2026-09-11
- GameWorld 获 ECCV 2026 多模态数字代理研讨会最佳论文亚军 — MikeShou1 · 2026-09-11
- GLIE 论文: late-interaction 检索向量可压缩 200 倍存储 — inductionheads · 2026-09-11
- 3D ResNet 论文八年突破 3000 引用,Kinetics 数据集成里程碑 — HirokatuKataoka · 2026-09-11
- 把数据调度变成优化的一部分:样本选择与排序影响 LLM 训练 — Puzzleheaded_Box2842 · 2026-09-11
- Jeff Heaton《神经网络数学导论》开放免费完整下载 — blaizedsouza · 2026-09-11