论文揭示 RL 未教推理新策略,新法成本降千倍
mark_k · x · 2026-08-16
一篇新论文指出,RL(强化学习)用于 LLM 推理时并未教给模型新策略,只是重新分配了模型已有的解决方案概率。编辑通常很稀疏(1-3% token),集中在高熵决策点,且几乎总是提升基座模型 Top-5 内的 token。
作者提出了 ReasonMaxxer,一种无需 RL 的方法,仅在这些熵门控点应用对比损失。实验表明,仅需数百次 rollout、几十个问题和单 GPU 几分钟,该法在成本降低约 1000 倍的情况下,在数学基准测试上匹配或击败了全量 RL。
所属事件:论文称RL未教LLM新策略,千分之一算力可复现收益(4 条相关)→
「模型」频道最新
- OpenAI 训练暂停引对比,Anthropic 曾静默暂停过训练 — JacquesThibs · 2026-10-02
- Hugging Face CEO:决策模型 Kev-4B 可在 llama.cpp 端侧免费运行 — ivan_bezdomny · 2026-10-02
- Grok Voice 登顶语音任务榜,任务成功率 94.6% 领先 GPT 与 Gemini — XFreeze · 2026-10-02
- 传 Opus 5.5 另有不同:用户称 Perplexity 搭载后表现惊艳 — inductionheads · 2026-10-02
- The Batch:开源 GLM-5.3 漏洞利用能力逼近 Claude,12% vs 14% — DeepLearningAI · 2026-10-02
- Gemini 4 Argon 幻觉率 15%,居 AA-Omniscience 榜首 — import_jmr · 2026-10-02