BPO:免 Critic 的镜像下降方法改进 LLM 推理 RL 训练
apodex · hf · 2026-09-23
论文提出 Bellman Policy Optimization(BPO),一种面向可验证奖励强化学习(RLVR)的免 critic 方法,由 Policy Mirror Descent(PMD)推导而来。对于带终局奖励的自回归生成,BPO 利用 Bellman 方程将 PMD 重构为轨迹级目标,避免估计中间状态价值,并证明该目标与原 PMD 具有相同唯一最优解。实用 BPO 损失通过对该目标近似得到,其 mismatch-correction 权重是互补 token 概率的平滑比值。在数学推理基准上的实验验证了方法有效性。
「研究」频道最新
- Simons Institute 联合 Jane Street 招募小组研究项目,10月15日截止 — jasondeanlee · 2026-09-23
- jev-gc:给长跑 Agent 做可逆上下文垃圾回收的开源方案 — Maleficent_College57 · 2026-09-23
- 网友算账:MiMo 论文 127 万条 rollout 轨迹,或只需 10 小时算力 — teortaxesTex · 2026-09-23
- Anthropic 研究员:AI 时代做科研该选的三类问题 — CatAstro_Piyush · 2026-09-23
- EA Explorer 公共数据快照开放下载:6.6GB 含 13 万条评论记录 — AaronBergman18 · 2026-09-23
- GAE提出几何原生潜空间:FVD降23%,相机误差减半 — yshan2u · 2026-09-23