Demystifying Reinforcement Learning Post-Training of Language Models
Donovan Clay, Saket Gollapudi, Sankar Harilal, Min Jang, Jacob Morrison, Sewoong Oh, Natasha Jaques
cs.LG, cs.AI, cs.CL
2026-08-25
华盛顿大学用受控玩具任务拆开 RLVR:稀疏奖励只能放大基座已有概率;给过程奖励后,Qwen2.5-7B 在一道 AIME 题上从 10.2% 做到 92.2%。
近两年 RLVR(用可验证对错当奖励做强化学习后训练)把数学和代码能力拉上来了,文献里同时出现两套互相打架的说法。Shao 等人发现,给 Qwen 数学模型喂随机甚至错误的奖励,数学分还能涨,于是有人怀疑后训练成功跟奖励对不对关系不大。Yue 等人用 pass@k 给出另一头:RL 之后小 k 变好,k 一大基座就追上,看起来 RL 只是把已有轨迹采得更勤,教不出新行为。
华盛顿大学和 Ai2 这篇 primer 不提出新算法。它把后训练拆成三块可调旋钮:基座先验、奖励粒度、prompt 分布,在能精确测概率的玩具任务上逐个拧,回答两个工程问题。稀疏奖励到底卡在哪。所谓虚假奖励涨分是不是普遍现象。
RL 算法本身被固定住,不比 PPO 和 GRPO。
基座先验用 SFT 人为拧。SFT+ 把目标行为的概率抬高(台词任务里目标句约占 20%,其余 80% 用其他电影对白,避免把模型洗崩)。SFT- 把交叉熵朝反方向推,把采样概率压到接近 0%。对照是原厂 Base。模型覆盖 Qwen2-1.5B / 7B、Qwen3-1.7B / 8B、Qwen2.5-7B-Instruct、OLMo 3 和 Qwen2.5-7B-Math。
两道任务。一道是让模型吐出指定电影台词,对错一眼能验,用 1 万次采样估概率。另一道是 AIME 2025 第 4 题:求 12x² − xy − 6y² = 0 在 ±100 整数范围内的有序对个数,答案 117,128 次采样。稀疏奖励就是对错二元,台词任务还加了长度惩罚,防止靠废话刷分。密奖励在台词上用 Levenshtein 编辑距离;在数学上用 Qwen2.5-32B-Instruct 当过程奖励模型,按这道题的五步标准解打部分分,权重 0.05 / 0.05 / 0.10 / 0.15 / 0.25 递增,答对 117 直接给 1.0,漏掉原点重叠的 118 给 0.6,循环推理扣 0.3,没有 boxed 扣 0.5。这种密信号是为这道题特制的梯子。
虚假奖励实验把奖励换成 [0, 1] 均匀随机。窄分布是 100 道数学题,宽分布是 1 万条(Qwen 用 WildChat,OLMo 用自家 RLVR 混合集)。OLMo 还从 Base / SFT / DPO 三个检查点各跑一遍,看熵更低的模型抗不抗得住随机奖励把分布打散。
台词任务上,稀疏奖励几乎是覆盖原则的现场演示:基座里有足够概率,就能学会;精确为 0,就学不会。
| 模型 | Base 先验 | 稀疏 RL 后 | SFT- |
| Qwen2-7B | 3.52% | 99.9% | 0% |
| Qwen3-1.7B | 0.48% | 10.0% | 0% |
| Qwen3-8B | 0.00% | 0.00% | 0% |
Qwen2-7B 先验约 3.5%,探索平台期大约 40 步之后收敛到 99.9%。Qwen3-1.7B 先验约 0.5%,稀疏卡在 10%。Qwen3-8B 先验精确为 0,一次都采不到目标句,稀疏和编辑距离都停在 0%。SFT+ 一律到 92%–100%。
密奖励能把有一点立足点的模型拉出来。Qwen3-1.7B Base 用编辑距离后精确匹配到 48.8%。Qwen2-1.5B Base 先验 0.31%,密奖励也只到 7.0%,小模型照样爬不出去。SFT+ 配密奖励反而低于稀疏,因为编辑距离给「差不多」也打分,不强迫一字不差。
AIME 上反差更硬。
| 配置 | SFT+ | Base | SFT- |
| 训练前 | 26.6% | 3.92% | 0.00% |
| 稀疏奖励 | 85.9% | 10.2% | 0.00% |
| 过程奖励 | 86.7% | 92.2% | 0.00% |
Base 稀疏几乎不动(3.92% → 10.2%),过程奖励跳到 92.2%,略超过被灌过正确答案的 SFT+(约 86%)。生成轨迹里出现了和 SFT+ 标准解不同的合法路径。SFT- 精确匹配始终 0%,密奖励下平均奖励爬到约 0.6:中间步骤能被重新拼上,最后一击仍过不去。
随机奖励只在「窄 prompt + 基座已经会」时像那么回事。Qwen 数学模型在 100 道数学 prompt 上能复现 Shao 的涨分;换成 WildChat 1 万条,MATH 几乎不涨,AMC 还掉。OLMo 没有那种数学先验。宽分布在约第 400 步熵突然升高,GSM8K、MMLU、IFEval 一起塌。窄分布熵还略降,GSM8K 从 86% 掉到约 32%,MMLU(约 65→62)和 IFEval(约 79→77)基本保住。窄分布是在把基座已经爱说的话变得更确定,对了就涨分,错了就定向污染。两种设置都没造出新能力。
给跑 RLVR 的人三条可操作的判断。稀疏可验证奖励默认是在重加权,搜不到基座几乎采不到的完整轨迹。想让模型学会这种行为,要先有覆盖,或者换过程级、可爬坡的奖励。Shao 那篇虚假奖励涨分不能当普遍规律抄,它绑在窄分布加偏数学的 Qwen 先验上。宽分布加随机奖励更接近把策略熵打上去,能力全局掉。这篇没有新算法,是把黑箱旋钮标了刻度。
实验刻意做成沙盒。台词是一句固定字符串,数学只做了一道 AIME,过程奖励还是按这道题的五步标准解手工设计的,外加 32B judge 和答对覆盖。这种密奖励在真实多题训练里造不出来,「密奖励能教新行为」目前只在高度知情的 shaping 下成立。Qwen3-8B 先验精确为 0 时,连编辑距离都拉不起来,密奖励也不是万能梯。论文自己把算法变体划出范围,因此不能回答换 GRPO 会不会改变覆盖阈值。Figure 5 的图注还把 Qwen2.5-7B-Instruct 的数字写成了 Qwen2-7B 的 28.8% / 3.5%,表 1 才是可信源。