研究揭示RL未必教会模型最有效的推理策略

Jeande_d · x · 2026-08-26

新论文探讨强化学习(RL)教导模型采用不同推理策略的有效性。研究发现,尽管基于RL的思维链模型在准确率上通常优于指令微调模型,但RL习得的行为策略并不总是与提高准确率最相关的策略。这意味着高准确率可能掩盖了推理过程中的低效路径。

所属事件:CMU与斯坦福论文:推理模型强化的行为多与正确性无关(5 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →