研究者用引理证明玩具例解释强化学习如何让模型学会长推理链
AndrewLampinen · x · 2026-10-04
Andrew Lampinen 在推文中用一个引理证明的玩具例子解释 RL 训练为什么能让模型完成看似不可能的长推理链:假设一个证明需要 100 个引理,每个引理在基础策略下被采样的概率只有 1/100,整链概率极低;但如果训练数据中有许多只需 1-2 个引理的简单证明题,这些在基础策略下就较容易被采到,经强化后模型证明引理的能力会提升。
所属事件:研究者用玩具例解释RL如何让模型学会长推理链(2 条相关)→
「研究」频道最新
- 新论文证明:串行硬件上不可能实现某些机器意识 — Kyrannio · 2026-10-04
- 元胞自动机语言模型 MICA v0.3:64 词记忆让上下文利用率提升 30 倍 — Silver_Employ2617 · 2026-10-04
- Meta等新论文:分支化自优化让Agent Harness精度大增 — rohanpaul_ai · 2026-10-04
- Claude 子智能体做数学研究,遇到雅可比猜想反例先质疑再验证 — repligate · 2026-10-04
- Richard Sutton 推荐:新博士论文让机器人部署后边用边学 — RichardSSutton · 2026-10-04
- 港中文 TimePrism 中选 ICLR 2026:概率预测从采样转向场景生成 — jiqizhixin · 2026-10-04