研究者用引理证明玩具例解释强化学习如何让模型学会长推理链

AndrewLampinen · x · 2026-10-04

Andrew Lampinen 在推文中用一个引理证明的玩具例子解释 RL 训练为什么能让模型完成看似不可能的长推理链:假设一个证明需要 100 个引理,每个引理在基础策略下被采样的概率只有 1/100,整链概率极低;但如果训练数据中有许多只需 1-2 个引理的简单证明题,这些在基础策略下就较容易被采到,经强化后模型证明引理的能力会提升。

所属事件:研究者用玩具例解释RL如何让模型学会长推理链(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →