研究发现:预训练损失可预测 RL 放大趋势
heghbalz · x · 2026-07-21
预训练损失可在非饱和区预测 RL 放大效应
这条线程给出的核心结论是:在非饱和区间,预训练损失可以预测固定 RL 计算量下的 post-RL pass@1。
- 作者拟合出一个局部对数线性规律。
- 奖励斜率与预训练 token 的对数近似线性增长。
- 附图展示了预训练指标与 RL 奖励斜率之间很强的相关性。
所属事件:新研究提出预训练与RL联合缩放律(18 条相关)→
「研究」频道最新
- 斯坦福团队推出全球最快分词器 Gigatoken — StanfordAILab · 2026-07-22
- Tabul AI 推出 Metal TreeSHAP,加速 Apple silicon 上的 Shapley 计算 — Scobleizer · 2026-07-22
- Reddit 转发 OpenAI 的 ChatGPT 广告页面 — EcstaticAsparagus509 · 2026-07-22
- 开源 runtime 让每个仓库自定义 AI 代码审查器 — ibabufrik · 2026-07-22
- DeepSWE:专攻真实 GitHub 场景的 AI 编码智能体评测基准 — pmz · 2026-07-22
- Claude 辅助写成的 Rust 太空经济模拟器,能跑数百艘自治船只 — kalcode · 2026-07-22