CMU与斯坦福论文:推理模型强化的行为多与正确性无关

CMU 与斯坦福团队合作的新论文研究了「思考模型」(推理模型)的推理行为与最终正确性之间的关联,得出一个颇具颠覆性的结论:推理模型强化的行为大多与任务成功无关,其优势另有来源。据 @Jeanded 转述,模型在自我纠正、假设测试、承认不确定性等行为上被大量放大,但这些行为与最终答对的关联度低,部分甚至呈负相关;真正能预测正确性的反而是置信度校准、知识对齐与自我觉察等几乎未被强化的行为。在 RL 视角下,这意味强化学习教会模型的策略并不总是与提升准确率最相关的策略,高准确率可能掩盖了推理路径的低效。

已确认

为什么重要

该研究挑战了「思维链中可见的推理行为就是成功原因」的直觉,提示高准确率可能建立在低效甚至无效的推理路径之上。作者希望这些结果能帮助理解并改进推理模型的训练方向——如果强化学习未必教会模型最有效的推理策略,未来对齐 RL 奖励与真正有效的行为可能成为提升推理效率的关键。

2026-08-26 ~ 2026-08-26 · 5 条相关

一手来源