AlignOPSD 决策对齐蒸馏,长程 Agent 性能超 GRPO 5.5-8.7%
Mingju Chen · hf · 2026-09-29
北航系研究者提出 AlignOPSD,针对长程 Agent 强化学习中「决策-时间戳错配」问题:特权教师的指导往往落在错误的时间步,而学生的一个决策本身可能跨越多步,导致局部监督的信用分配错位。
方法分两阶段:
- 决策对齐监督校正:在兄弟 rollout 中为学生的同一样本响应找到功能匹配的上下文重新打分,校准局部教师证据;
- 半马尔可夫层级信用分配:从对应关系变化中提取可变时长的决策区间,用校正后的证据在各区间及其轮次间分配基于结果的信用。
在 ALFWorld、WebShop、Search-QA 上用 Qwen2.5-3B/7B 评测,全部八组 backbone-指标对比中超过 GRPO 与 StepOPSD,相对 GRPO 提升 5.5%-8.7%,六组排名第一。代码已开源。
「编程与Agent」频道最新
- 社区维护的 AI 天使投资人名单上线:收录 51 位活跃天使、附来源与验证日期 — TheMoonMidas · 2026-09-29
- 400+ LLM Agent 住进 2004 年代 MMO 服务器,本地跑 Qwen 小模型 — kristiantalley679 · 2026-09-29
- px0 新版修复 LSP 内存泄漏与 ReDoS 漏洞,新增 CSV 表格渲染 — arpit_bhayani · 2026-09-29
- Reddit 网友分享完整 Prompt:让 Agent 长任务前先自建进度仪表盘 — myLifeintheStack · 2026-09-29
- 单机搭游戏开发 AI 团队:Meta Muse Glimmer 一次跑通音效工具链 — draginol · 2026-09-29
- 别急着招人:创业者称 AI 可承担过去 10 名员工的工作 — FinanceYF5 · 2026-09-29