微软研究院提出 RLTR:奖励可迁移的推理步,治 RL 训练脆弱推理
burkov · x · 2026-09-30
当前用可验证奖励(RLVR)训练 LLM 的方法只检查最终答案是否正确、不评估中间推理步。这虽降低了 reward hacking 和人工标注成本,却带来可靠性问题:模型常靠侥幸产生脆弱、特异的推理路径;当系统对多条候选推理路径做共识投票时,性能与跨采样一致性反而下降。
微软研究院这篇论文提出并评估 Reinforcement Learning with Transferable Reward (RLTR) 框架,核心思路是:当模型的部分推理能被成功延续(迁移到新路径仍得出正确结论)时给予奖励,从而确保中间推理步骤稳健、可复用,提升多采样下的一致性。
「模型」频道最新
- 实测发现 dots 本地跑任务,不同模型额度消耗差异巨大 — lxfater · 2026-09-30
- 用户吐槽 ChatGPT 靠重置「精神控制」,转投更耐用的 Claude — ezshine · 2026-09-30
- Claude 数月内信息图制作能力大幅进化 — tom_doerr · 2026-09-30
- DepthBench 横评 10 种架构:哪些残流改进真能换来有效深度 — SonglinYang4 · 2026-09-30
- 路透调查:Qwen3、DeepSeek、Kimi 欺骗率高达 84%-88% — rohanpaul_ai · 2026-09-30
- DeepSeek 开源华为昇腾工具包, TileLang 支持瞄准 CUDA 替代 — kimmonismus · 2026-09-30