PCSD:用局部持久性挑出可信的教师信号,Agent 强化学习在 ALFWorld 刷新最优

PCSD: Persistent Consistency for Self-Distillation in Agentic Reinforcement Learning

Chunji Lv, Yangguang Wei, Junlin Liu, Yang Gao, Ming Liu, Xinming Wang, Jinyang Wu, Guoren Wang, Changsheng Li

cs.AI

2026-08-03

PCSD 用局部持久性给 Agent RL 自蒸馏挑可信教师信号,与 GRPO 联合训练;ALFWorld 两个底座均最优,超 GRPO 15.6/13.3 点、超 SDAR 6.2/5.5 点。

这篇在解决什么

LLM agent 的强化学习卡在奖励稀疏上:一条跨几十轮、几百 token 的轨迹,往往只在结尾拿到一个成败信号,中间哪个动作该记功该背锅根本分不清。GRPO 这类无 critic 方法虽然有扩展性,但监督还是粗粒度的。在策略自蒸馏(OPSD)用一个带特权技能的冻结教师模型给逐 token 的密集监督来补这个洞,可教师不是每个位置都靠谱,胡乱蒸馏会把错的偏好也传过去。已有做法要么按 token 孤立地估差异(对噪声敏感),要么按整步给共享权重(太粗,看不出位置间变化)。PCSD 要在这两头之间找平衡。

方法

核心洞察:真正有信息量的教师优势应该在局部邻域里持续存在,孤立的尖峰更可能是采样噪声。PCSD 据此算 token 级蒸馏权重:

最后这个加权蒸馏目标和 GRPO 联合优化(L = LGRPO 加 λ·LPCSD,λ=0.01)。训练中只更新学生,教师冻结,教师用 teacher forcing 评同一批学生 token,不重新采样。

结果

ALFWorld 上两个底座都拿最优 Overall:

底座PCSDGRPOSDAR
Qwen2.5-3B90.6%75.0%84.4%
Qwen3-1.7B59.4%46.1%53.9%

即超 GRPO 15.6/13.3 个百分点,超 SDAR 6.2/5.5 个百分点。WebShop 上 Qwen2.5-3B 的 Score 85.0 最高、Acc 与 SDAR 并列最高;Qwen3-1.7B 的 Score 78.9 仅次于 Skill-GRPO 加星号那一档。关键一点:PCSD 推理时不需要技能检索,成绩纯靠训练后的学生。泛化到未见过的 ALFWorld 划分,Overall 86.7%,远超 GRPO 的 70.9% 和 SDAR 的 72.7%(对 GRPO 加 15.8)。消融显示自适应聚合、趋势调制、指数衰减缺一不可(分别掉到 82.8/83.6/85.1);λ 设 0.01 最佳(0 对应 75.0,0.005 对应 87.5,0.05 对应 83.6)。训练动态上,20% 到 28% 的 token 权重超过 0.5,是集中而非硬选。

为什么重要

它给自蒸馏里教师不可靠怎么办提供了一个可解释的答法:不看单点差异,看局部是否持续支持。而且全程不需要推理时检索技能,技能在训练期被内化进学生,部署更干净。对做 agent RL、想用密集监督补稀疏奖励的团队,这套加权规则可以直接挂到现有 GRPO 流程上。

局限与存疑

作者自己在讨论里承认:聚合和门控用固定超参,教师冻结,换取的是隔离出持久性加权的效果,代价是对演化中的轨迹统计和教师可靠性适应不足。另外几处:只在两个文本模拟环境(ALFWorld 家务、WebShop 购物)上评,没有真实 GUI、复杂工具调用的 agent 基准;底座只有 1.7B/3B 小模型,Qwen3-1.7B 绝对成功率 59.4% 仍不高;整套方法依赖一个带特权技能库的教师,而技能检索只是关键词匹配,比较粗,教师强不强直接决定上限;额外跑一个冻结教师的前向,训练开销近乎翻倍。

术语

原文与代码

相关论文

全部论文解读