新研究:强化学习未教 LLM 新策略,仅重排概率
mark_k · x · 2026-08-16
新论文分析指出,强化学习(RL)并未教给 LLM 新的推理策略,其作用仅是重新分配基础模型已有的解决方案概率。RL 的修改非常稀疏(仅 1-3% 的 token),且集中在高熵决策点,提升的 token 几乎都在原模型的 Top-5 中。
基于此,作者提出了无 RL 方法 ReasonMaxxer,利用对比损失仅在熵门控点进行修正。该方法仅需数百次 rollouts、数十个问题及单 GPU 数分钟训练,成本降低约 1000 倍,却在多个模型和数学基准上匹敌或超越完整 RL。该发现将推理提升问题重新定义为“稀疏策略选择”而非“能力学习”。
所属事件:论文称RL未教LLM新策略,千分之一算力可复现收益(4 条相关)→
「研究」频道最新
- 机器人运动清晰度与可预测性的基础研究 — tomssilver · 2026-08-17
- 新研究:CoT 监控不可靠,仅半数能捕捉投毒 — maksym_andr · 2026-08-17
- 类比海马体,揭示 AI Agent 在企业中失败的真相 — thebvg · 2026-08-17
- 非科班友好:深入浅出拆解 Transformer 与 LLM 架构 — Zulfikar_Ramzan · 2026-08-17
- UniProbe:可学习 token 级检测,减少 VLM 幻觉 55% — HaggaiMaron · 2026-08-17
- Zvi 提议泛化 AI “宪法”定义以适应更广系统 — TheZvi · 2026-08-17