Rethinking RL 论文:基于熵稀疏的推理优化新视角

mark_k · x · 2026-08-16

论文链接:https://t.co/FGelGZFpXR

该研究(Rethinking RL for LLM Reasoning)进一步证实,强化学习(RL)对 LLM 推理的提升并非通过学习新策略,而是通过“稀疏策略选择”。通过 token 级分析发现,RL 的有效修改仅集中在 1-3% 的高熵 token 位置,且这些 token 总是落在基础模型的 Top-5 候选中。

基于这一发现,作者提出了 ReasonMaxxer,一种极其廉价的后训练方法。它利用基础模型自身的熵来识别决策点,仅在这些位置应用对比损失,无需在线生成。实验表明,ReasonMaxxer 在 3 个模型族、6 个规模和 6 个数学推理基准上,匹配或超过了完整 RL 的性能。

所属事件:论文称RL未教LLM新策略,千分之一算力可复现收益(4 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →