论文提出LLM强化学习新优化目标

论文《The Mirage of Optimizing Training Policies》指出,LLM 强化学习常存在训练策略与推理策略失配,导致优化不稳定;作者主张将“单调推理策略”而非训练策略本身作为真正优化目标,以更贴近实际推理过程。

2026-07-07 ~ 2026-07-07 · 2 条相关