论文揭示 RL 未教推理新策略,新法成本降千倍

mark_k · x · 2026-08-16

一篇新论文指出,RL(强化学习)用于 LLM 推理时并未教给模型新策略,只是重新分配了模型已有的解决方案概率。编辑通常很稀疏(1-3% token),集中在高熵决策点,且几乎总是提升基座模型 Top-5 内的 token。

作者提出了 ReasonMaxxer,一种无需 RL 的方法,仅在这些熵门控点应用对比损失。实验表明,仅需数百次 rollout、几十个问题和单 GPU 几分钟,该法在成本降低约 1000 倍的情况下,在数学基准测试上匹配或击败了全量 RL。

所属事件:论文称RL未教LLM新策略,千分之一算力可复现收益(4 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →