AlignOPSD 决策对齐蒸馏,长程 Agent 性能超 GRPO 5.5-8.7%

Mingju Chen · hf · 2026-09-29

北航系研究者提出 AlignOPSD,针对长程 Agent 强化学习中「决策-时间戳错配」问题:特权教师的指导往往落在错误的时间步,而学生的一个决策本身可能跨越多步,导致局部监督的信用分配错位。

方法分两阶段:

在 ALFWorld、WebShop、Search-QA 上用 Qwen2.5-3B/7B 评测,全部八组 backbone-指标对比中超过 GRPO 与 StepOPSD,相对 GRPO 提升 5.5%-8.7%,六组排名第一。代码已开源。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →