把提示深度当高斯带抽样,1.5B家务任务成功率95.3%

Agent-G$^2$: Gaussian Guidance for Agentic Reinforcement Learning

Zixuan Wang, Yanrui Miao, Zhengxi Lu, Teng Pan, Yiwen Qiu, Hongxing Li, Peng Qiu, Ruiqing Zhang, Yongliang Shen

cs.AI, cs.CL

2026-08-24

Agent-G2发现有用的专家轨迹前缀是一条高斯带,不是一个最优点。用已有rollout在线估中心和宽度,Qwen2.5-1.5B在ALFWorld到95.3%,7B到98.4%,rollout开销不到逐样本探测的三分之一。

这篇在解决什么

长程Agent任务往往几十步才给一个终点奖励,从起点探索很难碰到成功。Hint-based RL的办法是先执行专家轨迹的一段前缀,让策略从更靠近成功的状态接着滚。前缀留多深是关键:太浅成功样本不够,太深奖励饱和、优势估不出来。

现有方法把深度当成一个确定标量。按训练步或批次反馈共用一个值,会忽略同一批里两步「Pick」和二十步「Pick Two」的难度差;逐样本二分或枚举倒是能对上单题,但要额外探测rollout。共用调度会把六成以上分配打出信息带;探测想把错配打近零,预算要到GRPO的20倍。

方法

诊断显示,有用深度是最优值附近的一条带,用Bernoulli方差当信息量,按相对最优深度对齐后,高斯拟合σ=0.22、R²=0.92。目标从「钉死一个点」变成「盖住这条带」。

Agent-G2离线按专家轨迹长度把题分成短/中/长簇。全局基线μglobal跟着批次成功率相对0.5上下挪;每簇用EMA维护成功率均值Ak和方差Vk。单题中心=全局基线+λ(0.5−Ak),宽度跟簇内方差走,再从该高斯抽一个比例,折成前缀长度,同一题的R次rollout共用这个前缀。策略更新是GRPO加上前缀上的teacher-forced损失。用来更新策略的那批rollout同时刷新高斯参数,不另做探测,也不训深度预测器。

结果

ALFWorld上,Qwen2.5-1.5B成功率95.3%,7B为98.4%。相对最强hint基线分别+1.5和+2.3,相对最强无hint RL(两边都是+3.9),相对Aux-RL里最强的RLVMR为+7.4 / +6.6。相对探测式Enumeration,1.5B高9.3、7B高2.3,且没有探测开销。WebShop上两个尺度奖励分都是92.3,购买成功率78.9% / 84.4%。1.5B的Agent-G2(95.3%)已经超过7B的BEACON(94.5%)。

方法(1.5B / ALFWorld)成功率
Full SFT56.3%
GRPO72.8%
BEACON91.4%
Target acc(最强调度)93.8%
Enumeration86.0%
Agent-G295.3%

消融里,改成只用均值、不抽样,掉到89.8%;改成均匀分布88.3%;取消分簇89.1%;去掉GRPO只剩前缀SFT则26.6%。每步墙钟约88秒,调度法57到80秒,探测法285到425秒(3.24到4.83倍)。

为什么重要

长程Agent的hint深度不该再当成一个全局旋钮或一次昂贵搜索。用策略优化时已经在付的rollout,就能按难度簇盖住那条可学带。1.5B靠调度设计超过更大的无hint基线,说明在稀疏奖励的家务和购物环境里,前缀分配本身就能换模型规模。

局限与存疑

每道训练题需要一条专家轨迹,没有示范就套不上。高斯形状来自这两个benchmark的信息量曲线;多峰或严重偏斜的深度剖面可能要换分布,不过均匀抽样消融说明「盖住带子」比精确形状更要紧。难度簇按轨迹长度离线切,策略变强后相对难度会变,簇不会跟着改。评测集中在ALFWorld和WebShop,数学推理上的hint文献没有直接对照。

术语

原文与代码

相关论文

全部论文解读