BPO:免 Critic 的镜像下降方法改进 LLM 推理 RL 训练

apodex · hf · 2026-09-23

论文提出 Bellman Policy Optimization(BPO),一种面向可验证奖励强化学习(RLVR)的免 critic 方法,由 Policy Mirror Descent(PMD)推导而来。对于带终局奖励的自回归生成,BPO 利用 Bellman 方程将 PMD 重构为轨迹级目标,避免估计中间状态价值,并证明该目标与原 PMD 具有相同唯一最优解。实用 BPO 损失通过对该目标近似得到,其 mismatch-correction 权重是互补 token 概率的平滑比值。在数学推理基准上的实验验证了方法有效性。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →