研究者用玩具例解释RL如何让模型学会长推理链

研究者 Andrew Lampinen 在推文中用一个引理证明的玩具例子解释强化学习训练为何能让模型完成看似不可能的长推理链。假设一个证明需要100个引理,每个引理在基础策略下被采样的概率很低,整条证明链几乎不可能出现;而经过强化训练后,单个有用引理的采样概率可提升到0.99,原本不可行的百步证明链因此变为可行,直观展示了RL带来的泛化能力。

2026-10-04 ~ 2026-10-04 · 2 条相关