论文提出LLM强化学习新优化目标
论文《The Mirage of Optimizing Training Policies》指出,LLM 强化学习常存在训练策略与推理策略失配,导致优化不稳定;作者主张将“单调推理策略”而非训练策略本身作为真正优化目标,以更贴近实际推理过程。
2026-07-07 ~ 2026-07-07 · 2 条相关
- 论文:LLM强化学习的训练-推理失配与单调推理策略 — Jing Liang · 2026-07-06
- 论文:LLM强化学习真正目标是单调推理策略 — _akhaliq · 2026-07-07