新研究:强化学习未教 LLM 新策略,仅重排概率

mark_k · x · 2026-08-16

新论文分析指出,强化学习(RL)并未教给 LLM 新的推理策略,其作用仅是重新分配基础模型已有的解决方案概率。RL 的修改非常稀疏(仅 1-3% 的 token),且集中在高熵决策点,提升的 token 几乎都在原模型的 Top-5 中。

基于此,作者提出了无 RL 方法 ReasonMaxxer,利用对比损失仅在熵门控点进行修正。该方法仅需数百次 rollouts、数十个问题及单 GPU 数分钟训练,成本降低约 1000 倍,却在多个模型和数学基准上匹敌或超越完整 RL。该发现将推理提升问题重新定义为“稀疏策略选择”而非“能力学习”。

所属事件:论文称RL未教LLM新策略,千分之一算力可复现收益(4 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →