不用反向传播训练 agent:进化策略在长视野任务上反超 RL,显存只要推理水平

Agentic ESOpt: Fine-Tuning Long-Horizon LLM Agents with Minimal GPU Requirements

Zhi Zheng, Rongsheng Chen, Yunpeng Ba, Zhenkun Wang, Yee Whye Teh, Wee Sun Lee

cs.LG

2026-08-18

NUS 与南科大提出 Agentic ESOpt,用全参数随机扰动加奖励加权更新替代反向传播,8.41GB 显存跑满参训练 Qwen 27B 网页 agent,15 轮视野数独上比最强 GRPO 基线高 12.5 个百分点。

这篇在解决什么

强化学习微调 LLM 在单轮任务上已经打过关,挪到长视野 agent 上就露怯。两处硬伤:

一是显存。Agentic RL(PPO、GRPO)要沿整条轨迹回传梯度,激活值、优化器状态、参考模型全得驻留显存。论文给了一组对照:Qwen3.5-4B 上 PPO 要 89.40GB,GRPO 要 58.88GB。27B 模型的全参 RL 在 4 张 H100 80GB 上直接不可行。

二是信用分配。轨迹 15 轮、只有终点一个 0/1 奖励,GRPO 的组相对优势算出来是轨迹级的,分不清哪一步好;PPO 加 critic 做轮级优势,但稀疏终点奖励下 critic 学不出可靠价值,早期优势估计基本是噪声。论文的理论分析很直白:策略梯度要累加 H 个动作的分数项,估计方差近似随 H 线性涨;ES 一次扰动对应一整条轨迹,方差不含这个 H 项。

方法

Agentic ESOpt 把 OpenAI 2017 年那套进化策略搬进 agent 微调。每步:采样 G 个全参数高斯扰动,各自跑完整轨迹拿环境奖励,奖励在种群内做 z-score 归一化,然后按归一化奖励加权平均扰动方向,更新参数。全程只前向,不反传。

显存账这么算:扰动不落地成完整参数张量,只存随机种子,扰动用原位加减恢复(文献里成熟的做法)。所以训练显存 = 推理显存,Qwen3.5-4B 是 8.41GB,比 GRPO 低 85.7%。

两个关键设计:

结果

三条实验线:

15 轮视野数独(受控实验,视野长度由遮格数严格定义):

视野 H最强 RLAgentic ESOpt
590.63(PPO)89.58
1067.71(GRPO)62.50
1540.63(GRPO)53.13

排序随视野翻转:PPO 赢在 5 轮,GRPO 赢在 10 轮,ES 赢在 15 轮。作者强调这个翻转比全胜更有信息量,与「视野越长 ES 相对优势越大」的方差分析吻合。算力对齐下墙钟时间还更短(15 轮场景 9.4 小时对 GRPO 19.0 小时)。

ReAct 式工具调用与 WebArena:

测试时自动启发式设计:把 ES 塞进 EoH 和纯采样流程,36 组配对比较赢 28 组。

为什么重要

这篇的说服力在于它没把 ES 卖成「便宜的替代品」,而是论证了在长视野、稀疏反馈的 agent 场景里 ES 是更匹配的优化机制。对工程侧的直接影响有两层:

显存账单改写了。8.41GB 训 4B、4 张 H100 训 27B 全参,这个门槛让中小团队能上手 agent 微调,不必等大厂的开源 RL 配方。而且提示空间优化(技能蒸馏、启发式搜索)和参数优化第一次能共用 rollout 协同跑,省一份数据。

适用边界也要认清:短视野任务上 RL 仍然占优(5 轮数独 PPO 领先),ES 的优势随视野增长才显现;环境评估本身很贵的场景,ES 多出来的独立评估次数会吃掉省下的反传成本,作者在局限里自己承认了这点。

局限与存疑

作者自述:

读下来再补:

术语

原文与代码

社区讨论

相关论文

全部论文解读