CMU与斯坦福论文:推理模型强化的行为多与正确性无关
CMU 与斯坦福团队合作的新论文研究了「思考模型」(推理模型)的推理行为与最终正确性之间的关联,得出一个颇具颠覆性的结论:推理模型强化的行为大多与任务成功无关,其优势另有来源。据 @Jeanded 转述,模型在自我纠正、假设测试、承认不确定性等行为上被大量放大,但这些行为与最终答对的关联度低,部分甚至呈负相关;真正能预测正确性的反而是置信度校准、知识对齐与自我觉察等几乎未被强化的行为。在 RL 视角下,这意味强化学习教会模型的策略并不总是与提升准确率最相关的策略,高准确率可能掩盖了推理路径的低效。
已确认
- 思考模型放大自我纠正、假设检验、不确定性承认等行为,但这些行为与成功关联弱甚至为负
- 与成功真正相关的置信度校准、知识对齐与自我觉察等行为几乎没有被放大
- 尽管如此,RL 思维链模型准确率仍通常优于指令微调模型
- 推理模型的核心优势在于「失败后的恢复能力」:在需要逐步计算的扩展推理任务中,失败后的恢复速度是非推理模型的 2-3 倍
为什么重要
该研究挑战了「思维链中可见的推理行为就是成功原因」的直觉,提示高准确率可能建立在低效甚至无效的推理路径之上。作者希望这些结果能帮助理解并改进推理模型的训练方向——如果强化学习未必教会模型最有效的推理策略,未来对齐 RL 奖励与真正有效的行为可能成为提升推理效率的关键。
2026-08-26 ~ 2026-08-26 · 5 条相关
一手来源
- CMU 与斯坦福论文:推理模型放大自我修正等行为,却难放大成功关联行为 — Jeande_d ·
- 推理模型通过“失败恢复”机制超越非推理模型 — Jeande_d ·
- 研究称推理模型强化行为与正确性关联弱 — Jeande_d ·
- 【源头】研究称推理模型强化行为与正确性关联弱 — Jeande_d · 2026-08-26
- 【源头】推理模型通过“失败恢复”机制超越非推理模型 — Jeande_d · 2026-08-26
- 研究称推理模型常强化无效行为,成功关联度低 — Jeande_d · 2026-08-26
- 【源头】CMU 与斯坦福论文:推理模型放大自我修正等行为,却难放大成功关联行为 — Jeande_d · 2026-08-26
- 研究揭示RL未必教会模型最有效的推理策略 — Jeande_d · 2026-08-26