用贝尔曼方程消掉中间价值,BPO 把 AIME 均分做到 50.5%

Bellman Policy Optimization

Zhuoqing Song, Haotian Xu, Xikun Zhang, Lidong Bing

cs.LG, cs.CL, math.OC

2026-09-15

BPO 从策略镜像下降出发,用贝尔曼方程把 token 优势收成轨迹级目标,不再估中间状态价值。Qwen3-30B-A3B-Base 上 AIME24–26 峰值均分 50.5%,比 CISPO 高 3.1 点,比 GRPO-ClipHigher 高 11.0 点。

这篇在解决什么

可验证奖励强化学习(RLVR)已经是推理模型的主训练手段。GRPO 一类方法按 prompt 采样一组回答,用组内归一化奖励当优势,再套 PPO 式裁剪。结局监督下,一条回答里所有 token 共享同一个优势,中间状态不再单独估价值。直接把策略镜像下降(PMD)搬过来仍会要每个前缀的优势或 Q 值,训 critic 又贵又不稳。目标是同一套 PMD 更新,但只使用终点奖励和这条 prompt 的期望奖励。

方法

把生成看成只有终点奖励的有限时域 MDP。非终止步的优势等于相邻状态价值之差,沿轨迹求和后只剩下 R(x,y)−V(x)。把 PMD 最优性条件按 token 加起来,得到轨迹残差:终点奖励减初始价值,再减各步 log 比与反向 KL。最小化该残差的平方,在 rollout 策略可达的状态上与原 PMD 有相同的唯一最优解。

直觉上,终点奖励设定下,前面每一步的「相对平均好多少」会沿生成链条抵消,最后只看见整道题对不对、以及这道题平均能得多少分。实践里做四步近似。残差在 π=μ 处线性化,梯度里的残差因子变成 R−V。V(x) 用组内平均奖励,prompt 权重用组内标准差的倒数,于是出现和 GRPO 一样的组归一化优势。完整词表 KL 太贵,换成二元 KL(该 token 对上「其他一切」),梯度乘子变成 (1−μ)/(1−π),也就是互补概率比。π 靠近 1 时这个比会爆,于是加平滑 ε 并封顶 C。损失外形仍像 GRPO,只是重要性采样比 r=π/μ 换成 ω=(1+ε−μ)/(1+ε−π)。实验取 ε=0.1、C=3.0,裁剪掩码规则同 GRPO。

结果

骨干 Qwen3-30B-A3B-Base,数据是 DAPO-Math-17k 英文子集。对照只换策略损失:GRPO-ClipHigher、GSPO、CISPO、DPPO。每步 256 条 prompt、每条 16 个回答、最长 16384 token,400 个训练步(每步 8 次优化)。评测 AIME24/25/26 的 Avg@32。

峰值均分:

方法AIME24AIME25AIME26均分
GRPO-ClipHigher45.634.838.039.5
GSPO50.335.544.643.5
CISPO52.739.050.447.4
DPPO55.839.244.246.4
BPO57.441.053.050.5

相对 CISPO +3.1,相对 GRPO +11.0。400 步结束时 BPO 均分 49.4,DPPO 为 45.5。三个子集都是 BPO 最高。训练曲线上 BPO 后半段仍在爬,没有出现对照里那种提前走平。Qwen3-4B-Base 上对 ε 和 C 做了消融,论文称一段区间内差不多,说明平滑和封顶不是把结果钉死在单一取值上。

为什么重要

RLVR 里大家已经不太愿意养 critic。BPO 给「不用 critic」补了一条从 PMD 推过来的理由:终点奖励设定下,中间价值可以消掉,实践损失只是把重要性权重换成互补概率比。若你在跑 GRPO/CISPO,改的是那一项乘子,不是整套采样栈。数学推理上的 3 到 11 个点,足够值得在现有框架里试一版。

局限与存疑

等价定理对的是轨迹级平方残差,落地损失经过线性化、二元 KL、平滑和裁剪,和定理之间有缝。只在一份数学数据和一个 30B-A3B 基座上比,没有代码或通用对话。组均值当 V(x) 在组很小或奖励全 0/1 时噪声大,这点和 GRPO 同源。AIME26 仍在用,题目泄露风险要自己判断。消融在 4B,不能直接解释 30B 的超参。

术语

原文与代码

相关论文

全部论文解读