BPO 论文:免重要性采样稳定 RLVR,AIME 平均准确率达 50.5%

青稞AI · wechat · 2026-09-28

青稞AI 社区解读论文《Bellman Policy Optimization》(arXiv:2609.15987),剖析 RLVR(可验证奖励强化学习)中的离策略问题并提出新解法。

离策略从何而来:同步训练的 mini-batch 切分、异步 rollout worker 滞后、partial rollout 跨模型版本、训练与推理引擎数值差异,都会让训练策略 π 偏离采样策略 μ。经典的重要性采样(IS)在长回答下方差爆炸,长度归一化的 GSPO 又不再是严格 IS。

BPO 的核心思路:结合策略镜像下降(PMD)与基于 rollout 策略的贝尔曼方程,将逐 token 优势条件沿轨迹望远镜求和消去中间价值项,得到无需 critic、无需 IS 权重的轨迹级平方残差目标。定理证明其与 PMMD 有相同最优解。实用近似采用「采样 token vs 词表其余」的二元 reverse KL 加平滑与裁剪。

与 score centering 的对比:两者在特定条件下 token 梯度等价;BPO 更轻量、rollout 侧每 token 只存 O(1) 信息、易接入 GRPO/PPO loss;score centering 用 top-k(默认 k=128)近似更接近全词表修正但开销更高。两者都无法解决 advantage 估计噪声等固有问题。

实验:在 Qwen3-30B-A3B-Base 上用 DAPO-Math-17k 训练,BPO 在 AIME 2024–2026 三基准平均准确率 50.5%,比 GRPO-ClipHigher 高 11 个百分点,比最强基线 CISPO 高 3.1 个百分点。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →