Agentic ESOpt: Fine-Tuning Long-Horizon LLM Agents with Minimal GPU Requirements
Zhi Zheng, Rongsheng Chen, Yunpeng Ba, Zhenkun Wang, Yee Whye Teh, Wee Sun Lee
cs.LG
2026-08-18
NUS 与南科大提出 Agentic ESOpt,用全参数随机扰动加奖励加权更新替代反向传播,8.41GB 显存跑满参训练 Qwen 27B 网页 agent,15 轮视野数独上比最强 GRPO 基线高 12.5 个百分点。
强化学习微调 LLM 在单轮任务上已经打过关,挪到长视野 agent 上就露怯。两处硬伤:
一是显存。Agentic RL(PPO、GRPO)要沿整条轨迹回传梯度,激活值、优化器状态、参考模型全得驻留显存。论文给了一组对照:Qwen3.5-4B 上 PPO 要 89.40GB,GRPO 要 58.88GB。27B 模型的全参 RL 在 4 张 H100 80GB 上直接不可行。
二是信用分配。轨迹 15 轮、只有终点一个 0/1 奖励,GRPO 的组相对优势算出来是轨迹级的,分不清哪一步好;PPO 加 critic 做轮级优势,但稀疏终点奖励下 critic 学不出可靠价值,早期优势估计基本是噪声。论文的理论分析很直白:策略梯度要累加 H 个动作的分数项,估计方差近似随 H 线性涨;ES 一次扰动对应一整条轨迹,方差不含这个 H 项。
Agentic ESOpt 把 OpenAI 2017 年那套进化策略搬进 agent 微调。每步:采样 G 个全参数高斯扰动,各自跑完整轨迹拿环境奖励,奖励在种群内做 z-score 归一化,然后按归一化奖励加权平均扰动方向,更新参数。全程只前向,不反传。
显存账这么算:扰动不落地成完整参数张量,只存随机种子,扰动用原位加减恢复(文献里成熟的做法)。所以训练显存 = 推理显存,Qwen3.5-4B 是 8.41GB,比 GRPO 低 85.7%。
两个关键设计:
三条实验线:
15 轮视野数独(受控实验,视野长度由遮格数严格定义):
| 视野 H | 最强 RL | Agentic ESOpt |
| 5 | 90.63(PPO) | 89.58 |
| 10 | 67.71(GRPO) | 62.50 |
| 15 | 40.63(GRPO) | 53.13 |
排序随视野翻转:PPO 赢在 5 轮,GRPO 赢在 10 轮,ES 赢在 15 轮。作者强调这个翻转比全胜更有信息量,与「视野越长 ES 相对优势越大」的方差分析吻合。算力对齐下墙钟时间还更短(15 轮场景 9.4 小时对 GRPO 19.0 小时)。
ReAct 式工具调用与 WebArena:
测试时自动启发式设计:把 ES 塞进 EoH 和纯采样流程,36 组配对比较赢 28 组。
这篇的说服力在于它没把 ES 卖成「便宜的替代品」,而是论证了在长视野、稀疏反馈的 agent 场景里 ES 是更匹配的优化机制。对工程侧的直接影响有两层:
显存账单改写了。8.41GB 训 4B、4 张 H100 训 27B 全参,这个门槛让中小团队能上手 agent 微调,不必等大厂的开源 RL 配方。而且提示空间优化(技能蒸馏、启发式搜索)和参数优化第一次能共用 rollout 协同跑,省一份数据。
适用边界也要认清:短视野任务上 RL 仍然占优(5 轮数独 PPO 领先),ES 的优势随视野增长才显现;环境评估本身很贵的场景,ES 多出来的独立评估次数会吃掉省下的反传成本,作者在局限里自己承认了这点。
作者自述:
读下来再补: