Le Critique: Privileged Value Functions for LLM Reinforcement Learning
Siddarth Venkatraman, Matthieu Dinot, Laurence Aitchison
cs.LG
2026-08-17
把标准答案或同组其余回答喂给价值函数做基线,Qwen3-4B 四项推理任务全部超过 GRPO 均值基线,Sudoku 解释方差从 0.03 升到 0.75。
RLHF 之后,LLM 强化学习的主流选择是 GRPO 这类无 critic 方法:同一个 prompt 采一组回答,用组内平均回报当基线,高于均值的推上去、低于均值的压下来。DeepSeek-R1 把这条路带火之后,value function 在 LLM RL 里基本被判了死刑:训练要额外一整套基础设施,critic 学得不好还会拖累策略,收益却一直说不清。
组相对方法有两个结构性代价。其一,优势是序列级的:整条回答所有 token 共享同一个优势值,没有 token 级的信用分配。其二,大组放大 straggler 效应:训练必须等组里最慢的那条 rollout 结束,异步管线里 off-policy 程度随之恶化。学出来的 value function 理论上两个问题都解:它给每个 token 前缀一个优势,而且不需要大组。这篇论文来自 Mistral AI、Mila 与蒙特利尔大学,要回答的是:怎么让 critic 的收益大到值得付它的基础设施成本。
两条互补的策略。
特权价值函数(PVF)。核心观察:RL 训练时手里常有一些策略看不到、但对预测回报极其有用的信息,比如数学题的标准答案、代码修复任务的 gold patch、验证器的评分细则,甚至同组其他 K−1 条回答及其回报。此前这些信息没有通道进入训练。PVF 的做法是把它们全部喂给 critic:critic 预测回报时不仅看策略的 token 历史,还看这些特权上下文。策略本身永远看不到它们。
合法性的关键在基线的无偏条件:基线只需与当前 token 在给定历史下条件独立。固定参考答案满足;未来 token、已实现的回报、当前回答自己产生的反馈不满足。所以 PVF 不能偷看「这条回答自己后来怎么样了」,但可以随便看别人的。特权信息只影响梯度方差,不动策略目标的方向,这是它相对自蒸馏路线的最大差别。自蒸馏引入新的分布匹配目标,改变了策略最优解,需要小心控制教师能看到什么;PVF 的特权信息只是让一个辅助模型预测得更准。
特权的具体形态按任务选:Reasoning Gym 给标准答案;CodeIO 没有参考解,就给同组其余 3 条回答加回报,critic 的任务退化成一个上下文内聚合判断;Sudoku 给完整解出的盘面。评估一步中间落子是否可行,本来需要隐式解开整道题,拿到解面后这个隐式推理直接消失。
TETHER。critic 训练不充分时(训练早期最典型),value 基线可能比组均值还差。TETHER 在两者之间自适应插值:基线取 (1−ρ)·组内 LOO 均值 + ρ·token 级价值。ρ 每批用最小二乘拟合「哪种混合最能预测实际回报」,再用 EMA 平滑。关键细节:本批的优势用上一批的 ρ 算,拟合只用已完成批次的回报,否则基线依赖自己的回报、无偏性被破坏。ρ=0 退回组基线,ρ=1 退回纯 value 基线,训练中不需要任何任务特定的调参。
Qwen3-4B-Instruct-2507(MiniF2F 用 Qwen3.5-4B),最终 50 步的平均奖励:
| 任务 | 组均值 GRPO | 普通 VF | PVF |
| Reasoning Gym(K=1) | — | 0.528 | 0.559 |
| Reasoning Gym(K=8) | 0.556 | 0.569 | 0.574 |
| CodeIO(K=4) | 0.518 | 0.517 | 0.542 |
| Sudoku(K=4) | 0.271 | 0.220 | 0.306 |
PVF 在全部四组设置里都是最好的方法。Sudoku 涨幅最大(0.271→0.306,普通 VF 反而掉到 0.220),作者的归因是长程多轮场景放大了特权信息的价值。解释方差(explained variance,衡量 critic 解释了多少回报方差)在每个环境都高于普通 VF,Sudoku 从 0.032 升到 0.751。这个差距与最终奖励差距一一对应。
TETHER 那组(加 MiniF2F):Reasoning Gym 0.581、CodeIO 0.534、MiniF2F 0.324,均超过组均值基线;Sudoku 0.255,没有完全追回均值基线的 0.271,但比普通 VF 的 0.220 明显止损。拟合出的 ρ 在训练中确实从 0 向中间值移动。
这是对「LLM RL 不需要 critic」这个行业默认的一次正面反击,而且反击的姿势很聪明:不跟 GRPO 拼基础设施,转而挖掘 critic 独有的能力,也就是利用策略拿不到的信息。对做 RL 训练的人,两条结论可以直接拿走:有标准答案或验证器的任务,PVF 几乎是无脑升级;已有 GRPO 管线想引入 value function,TETHER 是风险最低的入口,差就退回均值基线,好就吃到 token 级信用分配。价值函数训练基础设施已开源(prime-values,基于 PRIME-RL)。渐进式改进的成分当然存在,所有实验停在 4B,离前沿模型的 post-training 还有距离。
作者自述三条。第一,value 推理与训练要额外的 GPU 配置(附录里 VF/PVF 比均值基线多占一到两个专用节点),实验只匹配推理轨迹数、没有严格匹配总算力。第二,全部实验限于 4B 模型、最长 32,000 token 的回答。此外读下来还有几点:K 只测了 4 和 8,更大组会不会反过来利好均值基线,作者只是给了推理没有实验;λ 的附录实验显示 λGAE 从 1 调到 0.999888 就能显著改变 VF 和 PVF 的表现,主实验却全部固定 λ=1,这个敏感度本身就说明 value 路线的调参负担没有真正解决;Sudoku 的 TETHER 没追回均值基线,「自适应插值总能止损」并不成立。