Rethinking RL 论文:基于熵稀疏的推理优化新视角
mark_k · x · 2026-08-16
论文链接:https://t.co/FGelGZFpXR
该研究(Rethinking RL for LLM Reasoning)进一步证实,强化学习(RL)对 LLM 推理的提升并非通过学习新策略,而是通过“稀疏策略选择”。通过 token 级分析发现,RL 的有效修改仅集中在 1-3% 的高熵 token 位置,且这些 token 总是落在基础模型的 Top-5 候选中。
基于这一发现,作者提出了 ReasonMaxxer,一种极其廉价的后训练方法。它利用基础模型自身的熵来识别决策点,仅在这些位置应用对比损失,无需在线生成。实验表明,ReasonMaxxer 在 3 个模型族、6 个规模和 6 个数学推理基准上,匹配或超过了完整 RL 的性能。
所属事件:论文称RL未教LLM新策略,千分之一算力可复现收益(4 条相关)→
「研究」频道最新
- 实测多个提示词让 AI 文本 100% 骗过检测器 — paulnovosad · 2026-10-02
- Pangram 刻意不把 AI 翻译文本判为 AI 生成 — paulnovosad · 2026-10-02
- Schmidt Sciences 公布 28 名 AI2050 Fellow,图宾根 ELLIS 独占 3 席 — maksym_andr · 2026-10-02
- DATAFARM:对齐 TAMP 数据分布微调 VLA,让机器人既会规划也会灵巧操作 — tomssilver · 2026-10-02
- AACL 论文:多模态模型标注社交视频,统计校正可保证推理有效性 — krisgligoric · 2026-10-02
- 新论文:用多模态模型大规模分析短视频社会建构,如何保证结论有效 — krisgligoric · 2026-10-02