AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning
Zi-Han Wang, Zhengxi Lu, Zhiyuan Yao, Jinyang Wu, Jie Wu, Zhengzhou Cai, Yueqing Sun, Ziang Ye, Linji Hao, Qi Gu, Xunliang Cai, Yongliang Shen, Yujiu Yang
cs.AI, cs.LG
2026-08-06
长程 agent 里 GRPO 把整条轨迹的成功均摊到每一步,关键决策被淹没。AgentOPSD 把 token 级师生概率差聚合成逐轮证据,递归更新对数赔率空间的贝叶斯信念,在 ALFWorld 上把 7B 模型推到 89.1%。
用可验证奖励做 agent 强化学习(典型如 GRPO),奖励只给整条轨迹一个结果,这个结果优势会被平均摊到每一个 token 上。问题在于长程多轮任务里,真正决定成败的往往只是其中几步关键决策,把成功均摊等于把这些关键步淹没在噪声里,任务越长这个问题越严重。
已有工作把特权自蒸馏引入信用分配来提供更密的监督,但一个孤立的局部信号到底该怎么表达「顺序上的信用」,一直没有清晰答案。
AgentOPSD 把这件事重新表述成一个贝叶斯信念更新问题。它不需要 critic,也不需要额外的 rollout。
第一步,把每个 token 上的师生对数概率差聚合成「逐轮证据」。这里 teacher 是同一个策略在给定成功相关特权信息下的分支,student 是标准策略,两者的对数概率比作为这一轮的证据强度。第二步,把这个证据当成对「这条轨迹最终会不会成功」的信念更新:在对数赔率(log-odds)空间里递归地更新贝叶斯信念,初始信念用组成功率锚定。同一个局部证据在结局未定时可能是决定性的,在累积信念已经倒向某结局后就变得多余,递归更新正是捕捉了这种随历史变化的边际修正。第三步,把轨迹级优势重整成逐轮优势,带符号、有界、保持方向,在 λ=0 时退化为标准 GRPO。
整套机制和标准策略优化完全兼容,只是在每个 turn 上重新分配了学习信号。
三个交互环境、两个模型规模上做评测。
| 方法(Qwen2.5-7B) | ALFWorld 成功率 |
| GRPO | 81.2 |
| Skill-GRPO(用特权技能) | 88.3 |
| SDAR(强自蒸馏基线) | 85.9 |
| AgentOPSD | 89.1 |
3B 规模 ALFWorld 上 AgentOPSD 拿 84.4,Search-QA 准确率 49.2,WebShop 得分 90.2,多项也是最佳或并列。消融把每个部件拆开:去掉逐轮粒度退回逐 token 累积掉到 85.9,用原始局部证据替换递归信念更新掉到 82.8,丢掉与结局对齐的符号方向掉到 80.5,去掉成功率先验锚定掉到 78.9。符号方向和先验锚定影响最大。λ=0.5 最优,更小就退化。作者还画了任务长度敏感性:随着交互轮数变长,AgentOPSD 的成功率下降比 GRPO 平缓得多。
它给「逐轮信用分配」提供了一个有原理、又很省的方案:不要 critic、不要额外 rollout,纯靠递归信念重整就在标准 RL 流程里把稀疏结果奖励变成逐轮信号。理论部分把自蒸馏对数比和理想贝叶斯因子联系起来,解释了为什么一个局部 gap 本身不等于顺序信用。对长程 agent 训练,这是个直接可插拔的改进。
贝叶斯因子近似成立依赖一个「成功率足够低」的假设(论文里 ρk 趋于 0 的极限)。成功率不低的任务上,这个对数比估计会有偏,适用性没在更宽的成功率区间上验证。
训练时需要「成功相关特权技能」来构造 teacher 分支,这类特权信号不是所有任务都方便拿到。和最强基线 SDAR 比,AgentOPSD 在 ALFWorld-7B 上高 3.2 个点,但不是全面碾压:WebShop 的准确率 79.7 其实低于 SDAR 的 82.8。只在三个相对小的环境(ALFWorld、WebShop、Search-QA)上验证,更大规模、更开放的任务上表现未知。