Group Entropy-Controlled Policy Optimization
Guangran Cheng, Chengqi Lyu, Songyang Gao, Wenwei Zhang, Kai Chen
cs.CL
2026-07-18
GEPO 给 GRPO 的优势项按组熵做非对称缩放,解决多领域混合训练时的熵异质问题,13 基准平均 54.2,并修好 GRPO 的中途崩盘。
GRPO 这类强化学习方法现在普遍用来给推理模型做后训练。它对同一个 prompt 采 K 个回答,组内归一化算优势(advantage)。问题在于:同一个 base policy 下,不同领域的 prompt 熵差别很大,论文实测物理题组熵约 0.49、常识题约 0.81。GRPO 默认假设归一化后的优势在不同组之间是无偏的,但这个假设在熵异质时塌掉。具体说,当组内正确率 p 趋近 0,零均值约束会把正优势挤大、负优势摊薄,形成自我强化:低熵组越练越准、熵更低,高熵组拿到越来越弱的学习信号。结果是训练不稳,甚至崩盘。
GEPO(Group Entropy-Controlled Policy Optimization)的核心是给优势项按组熵做非对称缩放。先定义组熵:对一个 prompt 的 K 个回答,把每 token 对数概率平均一下得到 ℋg(x)。然后按 batch 统计算高低阈值:ℋlow = 均值 − βlow·标准差,ℋhigh = 均值 + βhigh·标准差,再用指数滑动平均平滑。
缩放规则(关键):
为什么是非对称(αhigh < αlow)?作者的理由是低熵组对激进干预更敏感,压太狠会触发长度塌缩(length collapse),回答越变越短。这套只在需要时干预,不增加采样成本,是 GRPO 上的轻量扩展。论文用的超参 αhigh=0.2、αlow=0.5、βhigh=0.3、βlow=0.2、γ=0.01。
两个 base 模型、13 个基准(数学、物理、代码、多模态、指令遵循等),每个 prompt 采 K=16。
Intern-S1-mini:
| 方法 | 平均 |
| Base | 50.9 |
| GRPO | 51.5 |
| AEPO | 51.8 |
| Clip-Cov / KL-Cov | 51.5 / 51.8 |
| GEPO | 54.2 |
Qwen3.5-9B:
| 方法 | 平均 |
| Base | 65.0 |
| GRPO | 70.7 |
| AEPO | 67.1 |
| GEPO | 71.2 |
单项上,Intern-S1-mini 的 IMO-Bench 从 29.8 到 38.8、GPQA 从 65.1 到 69.2、MMMU-Pro 从 55.0 到 59.8。消融:去掉低熵控制掉到 52.6,去掉高熵控制掉到 51.3,去掉非对称掉到 53.0,每块都有用。
最说明问题的是稳定性:Qwen3.5-9B 上 GRPO 在约第 170 步崩,AIME25 从约 85% 掉到约 40%;GEPO 全程平滑单调上升,熵轨迹稳定有界,而 GRPO 熵失控增长、AEPO 大幅震荡。
对做推理模型后训练的人,这篇戳中了一个真问题:多领域混合训练时,GRPO 的组归一化在不同熵的 prompt 组之间不是公平参照系。GEPO 的修法轻,不增加采样、不动主干网络结构、只改优势缩放,可以直接套在现有 GRPO 流水线上。它还顺带把训练稳定性这个工程痛点解了一半:熵门控让低熵组不会过早收敛、高熵组不会饿死,崩盘的风险明显降下来。
论文没有单独的 Limitations 小节。从内容看,几个点要留意:方法依赖「每 prompt 采 K 个回答」的分组采样结构,对单样本 RL 不适用;增益在两个模型上强度不同(Intern-S1-mini 上 +2.7,相对更明显;Qwen3.5-9B 上只比 GRPO 高 0.5),说明不是对所有 base 都同等有效;熵阈值靠 batch 统计自适应,但 α、β、γ 五个超参仍要手调,论文没给敏感性分析;13 个基准的平均分掩盖了单项波动,部分任务提升其实很小。