新研究:强化学习未教 LLM 新策略,仅重排概率
mark_k · x · 2026-08-16
新论文分析指出,强化学习(RL)并未教给 LLM 新的推理策略,其作用仅是重新分配基础模型已有的解决方案概率。RL 的修改非常稀疏(仅 1-3% 的 token),且集中在高熵决策点,提升的 token 几乎都在原模型的 Top-5 中。
基于此,作者提出了无 RL 方法 ReasonMaxxer,利用对比损失仅在熵门控点进行修正。该方法仅需数百次 rollouts、数十个问题及单 GPU 数分钟训练,成本降低约 1000 倍,却在多个模型和数学基准上匹敌或超越完整 RL。该发现将推理提升问题重新定义为“稀疏策略选择”而非“能力学习”。
所属事件:论文称RL未教LLM新策略,千分之一算力可复现收益(4 条相关)→
「研究」频道最新
- 实测多个提示词让 AI 文本 100% 骗过检测器 — paulnovosad · 2026-10-02
- Pangram 刻意不把 AI 翻译文本判为 AI 生成 — paulnovosad · 2026-10-02
- Schmidt Sciences 公布 28 名 AI2050 Fellow,图宾根 ELLIS 独占 3 席 — maksym_andr · 2026-10-02
- DATAFARM:对齐 TAMP 数据分布微调 VLA,让机器人既会规划也会灵巧操作 — tomssilver · 2026-10-02
- AACL 论文:多模态模型标注社交视频,统计校正可保证推理有效性 — krisgligoric · 2026-10-02
- 新论文:用多模态模型大规模分析短视频社会建构,如何保证结论有效 — krisgligoric · 2026-10-02