把 KL 从回答挪到题目,阿里 ERPO 六项数学基准平均高出 GRPO 6.2 点

Beyond the Stability-Exploration Dilemma: Environmental Regularization for LLM Policy Optimization

Xianlei Zhou, Xiangdi Meng, Yu He, Tianyu Qi, Shuyan Guan, Xianli Zhang, Jian Zhang, Xin Li, Qika Lin, Jun Liu

EMNLP 2026 main conference

cs.CL

2026-08-24

阿里 AMAP 提出 ERPO,用 Query-KL 约束模型对训练题的似然漂移,替换常规 Policy-KL。六项数学基准上 Avg@32 从 GRPO 的 0.274 提到 0.336,高温度解码和千步长训更稳。

这篇在解决什么

做 LLM 的强化学习后训练,手头几乎总有一项 Policy-KL:把当前策略的回答分布拉住,别离 SFT 参考模型太远。留着它,回答端的探索预算被吃掉;拿掉它,训练又缺少显式的漂移控制。稳定性和探索卡在同一项正则上。

阿里 AMAP 这组人指出,真正没被管住的是输入侧。训练语料可以完全固定,模型给每道训练题打的序列似然仍会跟着参数一起漂。他们把这个量叫做策略诱导的 query 分布 ρθ,把它相对 RL 开始前参考 ρθ0 的 KL 称为环境漂移。图 1 很直白:Policy-KL 预算钉死之后,Query-KL 仍一路往上爬,Policy-KL 几乎走平。约束回答分布,管不住题目这一侧。

方法

ERPO 把正则从回答挪到题目,两件套。

Proposition 1 给出结构性质:QKL 的梯度只走 ∇θ ℓθ(q),策略梯度里用的回答 score function ∇θ log πθ(o|q) 根本不出现。对回答分布没有直接的梯度压力,探索预算留在动作侧。

套到 GRPO、PPO、REINFORCE 只需三步:缓存 ℓθ0、外层按 w(q) 加权、用 QKL 替换原来的 Policy-KL。内层的 clip、baseline、组相对优势都不用动。实验里正则系数 α 沿用默认 0.01,跟原来 Policy-KL 系数对齐,方便对照。

结果

底座是 Qwen2.5-Math-7B 和 Qwen2.5-32B,EasyR1 框架,MATH Level 3–5 约 8.5K 题训 240 步,每题 8 条 rollout,最长 3K token。评测覆盖 AIME24/25、AMC、MATH500、Minerva、OlympiadBench,温度从 0.1 扫到 1.5 再取平均,避免只报某一个温度。

六项基准、温度平均后的主表:

方法Avg@32Pass@32Pass@1
Base0.1430.4630.149
GRPO0.2740.5750.275
ERPO0.3360.6110.332

相对 GRPO,三项分别 +6.2、+3.64、+5.69 个百分点。单科最大的一跳在 MATH500 的 Avg@32:0.528 到 0.677,对应文中说的最高 +14.9%。Minerva 的 Pass@32 是例外,ERPO 0.500,略低于 GRPO 的 0.516。

高温度才是更刺眼的对照。MATH500 上 Qwen-7B、每题 8 条时,温度 1.5 的 Pass@1,GRPO 是 0.40,跟没做 RL 的底座一样,基本废了;ERPO 加加权后是 8.60,α 加到 5×10^{-2} 能到 15.00。把 rollout 加到 16,同一温度 GRPO 10.60、ERPO 56.20。32B 更夸张:温度 1.5 时 GRPO 25.20、ERPO 80.80;低温段(≤1.0)从 81.62 到 84.60,高温段(1.2–1.5)从 57.20 到 82.80。

消融把两件套拆开。只换 Query-KL、不加权重,Qwen-7B 低温均值到 80.90,比 GRPO 的 68.80 高 12.1 点,文中写平均提升 15.9%。只加权不加 QKL(记作 GRPO)低温 76.14。Query-KL 一项就能把 batch 估计的 Query-KL 从 GRPO 的 0.9679 压到 0.0041;完整 ERPO 是 0.0828,Policy-KL 仍停在 0.0728,跟 GRPO 的 0.0601 同一量级,但不再靠显式 Policy-KL。

训到 1K 步时,GRPO 在温度低于 1.0 的区间能撑到约 240 步(15 个 epoch),400 步之后高温度先塌,再蔓延到所有温度。ERPO 也会掉一点,高温段甚至还往上走,但作者写明它并不能免疫崩盘:长时间训练仍可能熵突然升高、采样能力丢失。附录里 GRPO 在第 240 步出现经典 reward hacking 签名:训练准确率仍有 76.70,Eval@TP1 从约 75 掉到 58.40;ERPO 同期 Eval@TP1 仍是 78.40。训练-评测缺口从 6.47% 收到 3.14%,大约砍掉一半。DAPO 套上 ERPO,温度 ≤1.0 的均值 +10.24 点;RLOO 套上是 +2.28 点。把所有 KL 都拿掉,训练不收敛。

为什么重要

这是一次改正则位置的实验,不是新的优势估计器。已经在跑 GRPO 或 PPO 的人,改动面很小:一次离线缓存,加一项 QKL,拿掉 Policy-KL。代价几乎是零额外前向。

更实际的信号是评测协议。同样 240 步,温度 1.0 时两家差距没那么大,温度 1.5 时 GRPO 可以直接塌到底座水平。只报单一温度的 Pass@1,会把这种崩法藏起来。如果线上要做高温采样或多路径搜索,输入侧约束值得试。

它仍是渐进改进。A1 假设(把 ρθ 钉在 ρθ0 附近能保住前序阶段的泛化)被当成前提,不是定理,证据全在数学推理和 Qwen 家族上。

局限与存疑

作者自己列了三条:只做了数学基准和 Qwen;query 似然估计的质量和开销会随数据筛选机制、模型规模变;α 没有做完整扫描,默认 0.01 只是为了对齐原来的 Policy-KL 系数。

另外几处需要打问号。「环境」在这里等于模型给题目打的似然,真实的采样分布 ρtrain 始终固定。这和经典 RL 里转移核或初始状态分布漂移不是同一件事,只是一个类比。权重 w(q) ∝ ℓθ0(q) 也不是无偏密度比,clip 到 2 之后更不是。Qwen-7B、每题 8 条时,不加权重的 ERPO 在 ≤1.0 温度段反而最高(80.90 vs 带权重的 78.74),权重主要是在救高温。GRPO 始终学不会规定的思考标签格式,所以所有数字只报答案准确率,格式遵从度没有对照。Minerva Pass@32 上 ERPO 还略输。长训到 1K 步,ERPO 同样会崩,只是塌得慢一些。

术语

原文与代码

相关论文

全部论文解读