AgentOPSD:递归自蒸馏提升智能体强化学习,ALFWorld成功率89.1%

Tsinghua · hf · 2026-08-07

清华大学提出AgentOPSD,一种无需critic的递归方法,用于智能体强化学习中的回合级信用分配。它聚合token级教师-学生对数概率差距,并在对数几率空间递归更新贝叶斯信念状态,将稀疏结果监督转化为回合级信用信号。在ALFWorld、WebShop和Search-QA上使用Qwen2.5-3B/7B评估,AgentOPSD优于GRPO和强自蒸馏基线,在ALFWorld上达到89.1%成功率。消融实验表明增益来自回合级聚合和依赖历史的递归信念更新。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →