给权重加贝叶斯噪声采样多条策略,C3PO 在近等算力下数学均分超过 GRPO

Parameter Exploration for RLVR via Variational Learning

Vatsal Venkatkrishna, Nico Daheim, Iryna Gurevych

cs.LG, cs.AI, cs.CL

2026-08-11

把探索从采样温度挪到权重空间:用 IVON 给权重加贝叶斯噪声、采样多条策略再做 GRPO。7B 推理模型数学均分超过 GRPO,零优势死锁组更少,算力几乎不变。

这篇在解决什么

GRPO 是当下推理模型强化学习(RLVR,即用可验证奖励做 RL)的主流算法。它对每个问题一次性采样一组(G 个)回答,以组内奖励的均值做基线算 advantage:谁比平均分高就强化谁。这套机制有个先天短板:只要一组回答全部正确或全部错误,每个回答的 advantage 就都是零,这一组对梯度没有任何贡献,训练原地空转。这叫零优势组(zero-advantage group)。模型越训越强、越容易整组全对或全错,这种空转就越频繁,学习也就越容易卡住。

业界普遍的探索手段是调采样温度:温度高,token 分布更平,更容易采到不一样的回答。但温度只能改变每个位置上候选词的概率方差,改不了词与词之间的相对排序,且很容易把模型带偏导致发散。温度调高后采到的「不同」回答,终归是同一个概率分布的不同采样。作者要问的是:有没有一个跟调温度正交的探索维度。

方法

他们的答案是把探索从动作空间(token 概率)挪到参数空间(权重):给模型权重本身加噪声,采样出多条「不同的策略」,每条各自走自己的采样轨迹再算奖励。

噪声不是随便加的。他们用 IVON,一种变分贝叶斯学习优化器(类似 Adam 的贝叶斯版本,会顺带维护每个权重的后验方差)。每个权重按 θ̂ = m + σ⊙z 加噪,z 是标准正态,σ 由 IVON 估出的曲率(海森对角近似)和单个旋钮 λ 共同决定:σ = 1/√(λ(h+δ))。λ 越小噪声越大、探索越激进,是这套方法唯一的探索档位。关键在于,这个海森加权让噪声集中在对损失更敏感的权重上,等量但各向同性的随机噪声没用(后面消融会证实)。

三条策略怎么用这些扰动权重,是 3PO(扰动参数策略优化)这一族方法的核心区分:

结果

两个 7B 模型,数学推理在 AIME 2024-26、AMC、MATH-500、Minerva 上测,代码在 LiveCodeBench-v6 上测,对照是 GRPO 以及 GRPO 叠温度调度(Polaris)、熵正则等动作空间增强。

模型方法数学平均 Pass@1
OLMo-3-1025-7BGRPO42.99
OLMo-3-1025-7BC3PO44.04
Qwen2.5-Math-7BGRPO45.36
Qwen2.5-Math-7BC3PO46.88

平均涨幅约 1 到 1.5 个点,算力几乎不变。但收益高度集中在更难的基准上:Qwen 在最难的 AIME 2026 上从 20.42 跳到 26.25,接近 6 个点;代码任务 LCBv6 上 C3PO 拿到 15.17,明显超过 GRPO,而且只用了 GRPO 一半的训练步就追平其最终奖励。论文自己的解释是:任务越难、预训练后模型越弱,参数空间探索的收益越大。

训练动力学上收益更清楚。C3PO 和 M3PO 全程都比 GRPO 救回更多零优势组,而且产生的畸形或错误 rollout 更少。这正好回到开头那个痛点:探索维度变宽,「一组全错/全对」的死锁被打破,梯度信号重新流动。

但 C3PO 对 λ 极度敏感:λ=10⁸ 噪声过大,直接训崩,均分归零;λ=10⁹ 是最优;λ=10¹⁰ 又回落。消融还显示,把 IVON 的海森加权噪声换成等量各向同性噪声,均分掉到 42.12,反而低于 GRPO。起作用的不是「加噪声」本身,而是「按曲率加噪声」。

为什么重要

RLVR 是当下推理模型从 SFT 走向更强能力的主路径,零优势组是这条路上公认的瓶颈,模型越大、越聪明越严重。这篇给了一个跟调温度正交、且几乎不花额外算力的探索手段。对做 RL 训练的人,价值在于多了一个可调旋钮,尤其当现有动作空间方法把温度调度做到头、训练开始空转时。

要诚实地说:平均绝对涨幅不大(约 1 到 1.5 点),MATH-500、AMC 上 C3PO 与 GRPO 基本打平甚至略低,真正拉开差距的是 AIME 这类难题。把它当作「在难题和弱基线上更显著的渐进改进」更准确,不是一次范式跃迁。

局限与存疑

作者自己列了几条:只在 7B 上做了,算力受限,他们预期更大模型收益更高但未验证;M3PO/C3PO 虽算力持平,wall-clock 却要慢约 1.5 倍,因为现有 RL 代码栈都假设单一模型、并行度上不去,这是工程缺陷而非算法层面的问题;只用了对角后验,没试结构化非对角估计;推理时没做多采样。

读完还有两点存疑。一是 C3PO 对 λ 极度敏感且会训崩,而最优 λ 因模型而异(OLMo 用 10⁹,Qwen 用 10¹⁰),上到一个新模型要先扫一遍 λ,调参成本不低。二是增益集中在难题和弱基线,在已经很强的模型、已经饱和的基准上是否还能稳赢,论文没有给证据。

术语

原文与代码

相关论文

全部论文解读