Agent-G$^2$: Gaussian Guidance for Agentic Reinforcement Learning
Zixuan Wang, Yanrui Miao, Zhengxi Lu, Teng Pan, Yiwen Qiu, Hongxing Li, Peng Qiu, Ruiqing Zhang, Yongliang Shen
cs.AI, cs.CL
2026-08-24
Agent-G2发现有用的专家轨迹前缀是一条高斯带,不是一个最优点。用已有rollout在线估中心和宽度,Qwen2.5-1.5B在ALFWorld到95.3%,7B到98.4%,rollout开销不到逐样本探测的三分之一。
长程Agent任务往往几十步才给一个终点奖励,从起点探索很难碰到成功。Hint-based RL的办法是先执行专家轨迹的一段前缀,让策略从更靠近成功的状态接着滚。前缀留多深是关键:太浅成功样本不够,太深奖励饱和、优势估不出来。
现有方法把深度当成一个确定标量。按训练步或批次反馈共用一个值,会忽略同一批里两步「Pick」和二十步「Pick Two」的难度差;逐样本二分或枚举倒是能对上单题,但要额外探测rollout。共用调度会把六成以上分配打出信息带;探测想把错配打近零,预算要到GRPO的20倍。
诊断显示,有用深度是最优值附近的一条带,用Bernoulli方差当信息量,按相对最优深度对齐后,高斯拟合σ=0.22、R²=0.92。目标从「钉死一个点」变成「盖住这条带」。
Agent-G2离线按专家轨迹长度把题分成短/中/长簇。全局基线μglobal跟着批次成功率相对0.5上下挪;每簇用EMA维护成功率均值Ak和方差Vk。单题中心=全局基线+λ(0.5−Ak),宽度跟簇内方差走,再从该高斯抽一个比例,折成前缀长度,同一题的R次rollout共用这个前缀。策略更新是GRPO加上前缀上的teacher-forced损失。用来更新策略的那批rollout同时刷新高斯参数,不另做探测,也不训深度预测器。
ALFWorld上,Qwen2.5-1.5B成功率95.3%,7B为98.4%。相对最强hint基线分别+1.5和+2.3,相对最强无hint RL(两边都是+3.9),相对Aux-RL里最强的RLVMR为+7.4 / +6.6。相对探测式Enumeration,1.5B高9.3、7B高2.3,且没有探测开销。WebShop上两个尺度奖励分都是92.3,购买成功率78.9% / 84.4%。1.5B的Agent-G2(95.3%)已经超过7B的BEACON(94.5%)。
| 方法(1.5B / ALFWorld) | 成功率 |
| Full SFT | 56.3% |
| GRPO | 72.8% |
| BEACON | 91.4% |
| Target acc(最强调度) | 93.8% |
| Enumeration | 86.0% |
| Agent-G2 | 95.3% |
消融里,改成只用均值、不抽样,掉到89.8%;改成均匀分布88.3%;取消分簇89.1%;去掉GRPO只剩前缀SFT则26.6%。每步墙钟约88秒,调度法57到80秒,探测法285到425秒(3.24到4.83倍)。
长程Agent的hint深度不该再当成一个全局旋钮或一次昂贵搜索。用策略优化时已经在付的rollout,就能按难度簇盖住那条可学带。1.5B靠调度设计超过更大的无hint基线,说明在稀疏奖励的家务和购物环境里,前缀分配本身就能换模型规模。
每道训练题需要一条专家轨迹,没有示范就套不上。高斯形状来自这两个benchmark的信息量曲线;多峰或严重偏斜的深度剖面可能要换分布,不过均匀抽样消融说明「盖住带子」比精确形状更要紧。难度簇按轨迹长度离线切,策略变强后相对难度会变,簇不会跟着改。评测集中在ALFWorld和WebShop,数学推理上的hint文献没有直接对照。