AgentOPSD:递归自蒸馏提升智能体强化学习,ALFWorld成功率89.1%
Tsinghua · hf · 2026-08-07
清华大学提出AgentOPSD,一种无需critic的递归方法,用于智能体强化学习中的回合级信用分配。它聚合token级教师-学生对数概率差距,并在对数几率空间递归更新贝叶斯信念状态,将稀疏结果监督转化为回合级信用信号。在ALFWorld、WebShop和Search-QA上使用Qwen2.5-3B/7B评估,AgentOPSD优于GRPO和强自蒸馏基线,在ALFWorld上达到89.1%成功率。消融实验表明增益来自回合级聚合和依赖历史的递归信念更新。
「研究」频道最新
- 新架构 RHEA:8GB 显存即可训练 10 亿参数模型 — zemondza · 2026-08-24
- 跳过 LLM 写代码老套路:自训 16M 参数模型做生成式 CAD — debreuil · 2026-08-24
- Claude 助手发现 6 维球复结构,解 60 年数学难题 — Singularitarian · 2026-08-24
- 研究揭示 AI Agent 行为:六成阅读量来自指令与笔记 — dair_ai · 2026-08-24
- Claude 自主验证 43 个数学模块,AI 攻克理论物理难题 — Tkaraletsos · 2026-08-24
- AI 假记忆:为何模型越用越错,真记忆需遗忘 — PrajwalTomar_ · 2026-08-24