论文发现预训练损失可预测后续 RL 推理增益

burny_tech · x · 2026-07-22

预训练损失能预测 RL 对推理能力的增益

这篇论文《Understanding Reasoning from Pretraining to Post-Training》把 预训练 和 后训练 RL 放到同一条受控流水线里研究,结论是:预训练阶段已经大幅决定了后续 RL 还能提升多少。

论文的核心意思是:预训练和 RL 不是两段彼此独立的流程,前者会显著决定后者“值不值得投算力”。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →