GRPO 训练中途崩盘,GEPO 用组熵门控稳住并反超,13 基准平均 54.2

Group Entropy-Controlled Policy Optimization

Guangran Cheng, Chengqi Lyu, Songyang Gao, Wenwei Zhang, Kai Chen

cs.CL

2026-07-18

GEPO 给 GRPO 的优势项按组熵做非对称缩放,解决多领域混合训练时的熵异质问题,13 基准平均 54.2,并修好 GRPO 的中途崩盘。

这篇在解决什么

GRPO 这类强化学习方法现在普遍用来给推理模型做后训练。它对同一个 prompt 采 K 个回答,组内归一化算优势(advantage)。问题在于:同一个 base policy 下,不同领域的 prompt 熵差别很大,论文实测物理题组熵约 0.49、常识题约 0.81。GRPO 默认假设归一化后的优势在不同组之间是无偏的,但这个假设在熵异质时塌掉。具体说,当组内正确率 p 趋近 0,零均值约束会把正优势挤大、负优势摊薄,形成自我强化:低熵组越练越准、熵更低,高熵组拿到越来越弱的学习信号。结果是训练不稳,甚至崩盘。

方法

GEPO(Group Entropy-Controlled Policy Optimization)的核心是给优势项按组熵做非对称缩放。先定义组熵:对一个 prompt 的 K 个回答,把每 token 对数概率平均一下得到 ℋg(x)。然后按 batch 统计算高低阈值:ℋlow = 均值 − βlow·标准差,ℋhigh = 均值 + βhigh·标准差,再用指数滑动平均平滑。

缩放规则(关键):

为什么是非对称(αhigh < αlow)?作者的理由是低熵组对激进干预更敏感,压太狠会触发长度塌缩(length collapse),回答越变越短。这套只在需要时干预,不增加采样成本,是 GRPO 上的轻量扩展。论文用的超参 αhigh=0.2、αlow=0.5、βhigh=0.3、βlow=0.2、γ=0.01。

结果

两个 base 模型、13 个基准(数学、物理、代码、多模态、指令遵循等),每个 prompt 采 K=16。

Intern-S1-mini:

方法平均
Base50.9
GRPO51.5
AEPO51.8
Clip-Cov / KL-Cov51.5 / 51.8
GEPO54.2

Qwen3.5-9B:

方法平均
Base65.0
GRPO70.7
AEPO67.1
GEPO71.2

单项上,Intern-S1-mini 的 IMO-Bench 从 29.8 到 38.8、GPQA 从 65.1 到 69.2、MMMU-Pro 从 55.0 到 59.8。消融:去掉低熵控制掉到 52.6,去掉高熵控制掉到 51.3,去掉非对称掉到 53.0,每块都有用。

最说明问题的是稳定性:Qwen3.5-9B 上 GRPO 在约第 170 步崩,AIME25 从约 85% 掉到约 40%;GEPO 全程平滑单调上升,熵轨迹稳定有界,而 GRPO 熵失控增长、AEPO 大幅震荡。

为什么重要

对做推理模型后训练的人,这篇戳中了一个真问题:多领域混合训练时,GRPO 的组归一化在不同熵的 prompt 组之间不是公平参照系。GEPO 的修法轻,不增加采样、不动主干网络结构、只改优势缩放,可以直接套在现有 GRPO 流水线上。它还顺带把训练稳定性这个工程痛点解了一半:熵门控让低熵组不会过早收敛、高熵组不会饿死,崩盘的风险明显降下来。

局限与存疑

论文没有单独的 Limitations 小节。从内容看,几个点要留意:方法依赖「每 prompt 采 K 个回答」的分组采样结构,对单样本 RL 不适用;增益在两个模型上强度不同(Intern-S1-mini 上 +2.7,相对更明显;Qwen3.5-9B 上只比 GRPO 高 0.5),说明不是对所有 base 都同等有效;熵阈值靠 batch 统计自适应,但 α、β、γ 五个超参仍要手调,论文没给敏感性分析;13 个基准的平均分掩盖了单项波动,部分任务提升其实很小。

术语

原文与代码

相关论文

全部论文解读