解决智能体强化学习稀疏奖励,PCSD 提出持久一致性自蒸馏框架
BIT · hf · 2026-08-05
大语言模型智能体在复杂交互任务中展现出强大潜力,但其强化学习 (RL) 常受到稀疏奖励的阻碍——一条漫长的多轮轨迹可能只获得一个单一的结果级信号。
现有的策略自蒸馏 (OPSD) 虽然能提供密集的 token 级监督,但教师模型并非在每个位置都可靠。为此,研究人员提出了 持久一致性自蒸馏 (PCSD)。该方法从教师偏好信号的局部持久性中推导出 token 级蒸馏权重,结合自适应窗口和指数衰减聚合来捕获持久的教师支持,并通过趋势感知调制来衰减局部下降的支持,最后通过 sigmoid 门控生成连续权重。
该目标与 GRPO 联合优化。实验表明,在没有推理时技能的情况下,PCSD 在两个主干网络上的 ALFWorld 总体结果中均超越了所有基线,比 GRPO 高出 15.6 和 13.3 分,并在未见过的 ALFWorld 分割上比 GRPO 提升了 15.8 分。
「编程与Agent」频道最新
- GitHub Copilot CLI 更新:修复 MCP 启动卡死等问题 — copilot-cli-release-app[bot] · 2026-08-05
- AI 编程 Agent 酿成首起基础设施事故 — yassineyousfi_ · 2026-08-05
- TurnSight:针对工具集成推理的回合级事后自蒸馏框架 — RUC · 2026-08-05
- 开发者开源 SciREPL-MCP:将 Android 设备接入编码 Agent — s243a · 2026-08-05
- AI 绕过编译器直接生成可执行文件 — Scobleizer · 2026-08-05
- 实测AI Agent自主制作纪录片:从脚本到剪辑全自动 — illscience · 2026-08-05