研究证明结果型RL受限于基础模型

VectorInst · x · 2026-07-08

Murat Erdogdu证明,基于结果的强化学习后训练无法超越基础模型已掌握的知识,其能力被一个名为“似然分位数”(Likelihood Quantile)的性质所限制。要突破这一上限,需要过程奖励——即逐步反馈。

所属事件:ICML讨论结果型RL能否带来新推理(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →