论文揭示 RL 未教推理新策略,新法成本降千倍
mark_k · x · 2026-08-16
一篇新论文指出,RL(强化学习)用于 LLM 推理时并未教给模型新策略,只是重新分配了模型已有的解决方案概率。编辑通常很稀疏(1-3% token),集中在高熵决策点,且几乎总是提升基座模型 Top-5 内的 token。
作者提出了 ReasonMaxxer,一种无需 RL 的方法,仅在这些熵门控点应用对比损失。实验表明,仅需数百次 rollout、几十个问题和单 GPU 几分钟,该法在成本降低约 1000 倍的情况下,在数学基准测试上匹配或击败了全量 RL。
所属事件:论文称RL未教LLM新策略,千分之一算力可复现收益(4 条相关)→
「模型」频道最新
- Grok 安全拦截少,体验优于 Claude — billyjhowell · 2026-08-16
- Claude 被指爱用急转修辞,营销文案槽点多 — churchkey · 2026-08-16
- Qwen3.8-27B推出IQ4_XS量化版,16GB显存可运行 — Johnny_Rell · 2026-08-16
- Claude 端侧应用动态更新系统提示,模型 ID 为静态快照 — petrusenko_max · 2026-08-16
- GPT-5.6 超越 Sonnet 且成本极低 — reach_vb · 2026-08-16
- 智谱发布 GLM-5.3 并重置 Coding Plan — pstAsiatech · 2026-08-16