进化策略比 GRPO 更能保住 Pass@K,大漂移不等于遗忘

Understanding Evolution Strategies for LLM Reasoning: Broader Reasoning Coverage than GRPO

Yunpeng Ba, Zhi Zheng, Yue Xie, Jiaqing Li, Xialiang Tong, Tao Zhong, Mingxuan Yuan, Zhichao Lu, Xuyang Wu, Zhenkun Wang

cs.LG

2026-08-28

ES 在 GSM8K 与 DeepScaleR 后训练中 Pass@1 略低于 GRPO,但 Pass@16/@32 更高且少见熵崩塌。参数漂移是 GRPO 的约 40 倍,任务增益却集中在少数大幅度坐标。

这篇在解决什么

Evolution Strategies(ES)用参数扰动加前向评估来微调 LLM 推理,不走反向传播,省显存、好并行。它和主流的 Group Relative Policy Optimization(GRPO)都在优化校验器奖励,更新路径完全不同:GRPO 在单一策略上对一组回答做 token 级优势反传;ES 在参数空间里养一群扰动策略,用奖励加权扰动估计更新方向。

GRPO 能抬 Pass@1,也容易把策略熵压塌,大 K 的 Pass@K 甚至掉到基座以下。已有工作还把 ES 的大幅参数漂移直接等同于灾难遗忘。这篇要回答三件事:ES 会不会也把推理路径收窄;大漂移是不是必然遗忘;规模变大时该怎么设超参。

方法

ES 对参数加高斯扰动,前向滚出奖励,群体内做 z-score,再把标准化奖励当作权重平均扰动方向。理论部分把群体多样性写成校验器投影后的 Jensen–Shannon 散度:参数扰动诱导不同成功概率的策略,跨成员采样比在单一策略上重复采样更容易碰到正确答案;奖励加权在权重与成员成功率正相关时,还能把质量偏向更成功的成员。只要中心模型更新后还留得住这块边际,Pass@K 可以一起涨。

实验分两档。Easy:Qwen2.5-1.5B/7B-Instruct 和 Llama-3.2-3B-Instruct 在 GSM8K 上训两轮。Hard:DeepSeek-R1-Distill-Qwen-1.5B 在 DeepScaleR 上训一轮。对照是匹配预算的 GRPO,外加两种顺序拼接:ES→GRPO 和 GRPO→ES。遗忘实验按更新幅度阈值把小坐标清零,看任务表现还剩多少;held-out 覆盖 GPQA、MBPP、CSQA 等。超参扫了奖励归一化、扰动尺度、群体大小 $N$ 和一点/两点估计。

结果

Pass@K 的分化很清楚。GSM8K 后六项平均,Qwen2.5-1.5B 基座 41.0 / 75.4 / 80.2(Pass@1 / @16 / @32),GRPO 42.9 / 75.1 / 79.9,ES 41.5 / 76.0 / 80.9。Llama-3.2-3B 基座 44.1 / 74.0 / 78.6,GRPO 47.1 / 72.7 / 77.0,ES 45.9 / 75.8 / 80.4。Qwen2.5-7B 上 GRPO 仍赢 Pass@1(61.0 vs ES 59.6),ES 在 @16/@32 更高(80.6 / 83.1 vs GRPO 79.0 / 81.5)。Easy 档 18 组对照里,GRPO 有 15 组 @16 和 @32 双双低于基座。Hard 数学平均:基座 47.7 / 73.5 / 77.4,GRPO 52.9 / 74.7 / 78.0,ES 49.9 / 75.0 / 78.9;ES→GRPO 把 @1 拉回 52.3,同时拿到最高 @16/@32(75.8 / 79.2)。

训练动态上,GRPO 在 GSM8K 期间 GPQA token 熵明显下降,ES 的熵基本稳住。

参数几何:Full ES 相对初始化的 $L2$ 距离是匹配 GRPO 的 40.7–44.1 倍。$ au=1.5\times10^{-3}$ 时,77.6–93.0% 的非零更新都落在这个阈值以下;把这些小更新清零,目标任务 Pass@1 大体还在,要到很高稀疏度才掉。ES 最大更新集中在 LayerNorm 和注意力投影,GRPO 最大更新落在 embedding 或 LM head,幅度还小一到两个数量级。held-out 上 ES 的平均 Pass@32 不低于基座,先前那份「ES 必遗忘」的证据更像小训练集过拟合。

超参:z-score 是有效训练的关键;推理任务上两点估计没有带来 SFT 里常见的方差优势。群体需求随模型变大而下降:Qwen2.5-0.5B 要 $N=32$ 才接近 $N=64$,1.5B 和 3B 上 $N=16$ 已经够用。

为什么重要

ES 不该再被写成「省显存的弱 GRPO」。它是另一种后训练:Pass@1 通常让一点,换来重复采样时更宽的成功覆盖。真要单次正确率,可以先 GRPO 再 ES,或反过来,用同一预算换 Pareto 点。功能稀疏也解释了全参数 ES 为什么在十亿级模型上还能动:增益不靠每个坐标都改。

部署上,大模型可以先用更小群体;奖励一定要做群体内标准化。想挖基座里低概率但正确的推理路径,ES 比继续加 GRPO 步数更对症。

局限与存疑

Pass@1 的主升幅仍在 GRPO 一边,ES 单独当生产配方,单次正确率可能不够。顺序拼接的哪一头更好,随任务变(AIME24 偏 ES→GRPO,AIME25 偏 GRPO→ES),没有稳定的默认顺序。遗忘结论来自一轮或两轮后训练,多任务连续适应会不会把随机游走攒成真遗忘,论文自己也标成未决。理论把 Pass@K 增益写成中心转移误差够小,这个误差在真实 LLM 上没有直接测。最大更新落在 LayerNorm,也还没有干预实验证明那就是因果位点。

术语

原文与代码

相关论文

全部论文解读