微软研究院提出 RLTR:奖励可迁移的推理步,治 RL 训练脆弱推理

burkov · x · 2026-09-30

当前用可验证奖励(RLVR)训练 LLM 的方法只检查最终答案是否正确、不评估中间推理步。这虽降低了 reward hacking 和人工标注成本,却带来可靠性问题:模型常靠侥幸产生脆弱、特异的推理路径;当系统对多条候选推理路径做共识投票时,性能与跨采样一致性反而下降。

微软研究院这篇论文提出并评估 Reinforcement Learning with Transferable Reward (RLTR) 框架,核心思路是:当模型的部分推理能被成功延续(迁移到新路径仍得出正确结论)时给予奖励,从而确保中间推理步骤稳健、可复用,提升多采样下的一致性。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →