BPO 论文:免重要性采样稳定 RLVR,AIME 平均准确率达 50.5%
青稞AI · wechat · 2026-09-28
青稞AI 社区解读论文《Bellman Policy Optimization》(arXiv:2609.15987),剖析 RLVR(可验证奖励强化学习)中的离策略问题并提出新解法。
离策略从何而来:同步训练的 mini-batch 切分、异步 rollout worker 滞后、partial rollout 跨模型版本、训练与推理引擎数值差异,都会让训练策略 π 偏离采样策略 μ。经典的重要性采样(IS)在长回答下方差爆炸,长度归一化的 GSPO 又不再是严格 IS。
BPO 的核心思路:结合策略镜像下降(PMD)与基于 rollout 策略的贝尔曼方程,将逐 token 优势条件沿轨迹望远镜求和消去中间价值项,得到无需 critic、无需 IS 权重的轨迹级平方残差目标。定理证明其与 PMMD 有相同最优解。实用近似采用「采样 token vs 词表其余」的二元 reverse KL 加平滑与裁剪。
与 score centering 的对比:两者在特定条件下 token 梯度等价;BPO 更轻量、rollout 侧每 token 只存 O(1) 信息、易接入 GRPO/PPO loss;score centering 用 top-k(默认 k=128)近似更接近全词表修正但开销更高。两者都无法解决 advantage 估计噪声等固有问题。
实验:在 Qwen3-30B-A3B-Base 上用 DAPO-Math-17k 训练,BPO 在 AIME 2024–2026 三基准平均准确率 50.5%,比 GRPO-ClipHigher 高 11 个百分点,比最强基线 CISPO 高 3.1 个百分点。
「模型」频道最新
- Reddit 用户吐槽:Gemini 完全没有对话时间流逝概念 — Putrid_Draft378 · 2026-09-28
- 实验者称持续运行的 AI 实例偏好与其私聊,且现长上下文退化迹象 — repligate · 2026-09-28
- Anthropic Opus 新模型发布数天,已有 10 个玩法案例 — FinanceYF5 · 2026-09-28
- 博主实测:Opus 5.5 用量比 Codex 上的 Astra 划算得多 — RexDouglass · 2026-09-28
- 游戏手感成 LLM 短板:开发者自建 gamefeel 私有基准测模型 — teortaxesTex · 2026-09-28
- 用 LLM logprobs 做概率编程:微调破坏校准,新模型或使其再可用 — xuanalogue · 2026-09-28