NVIDIA 论文 PivotOPD:教多轮智能体从早期关键错误中恢复

MohitIyyer · x · 2026-10-01

新论文 PivotOPD: Learning to Recover from Pivotal Mistakes in Multi-Turn Agents(arXiv:2609.40285,作者含 Jan Kautz、Ali Hatamizadeh 等 NVIDIA 研究者)。

论文动机:在线策略蒸馏(OPD)训练语言智能体时,多轮交互中一个早期错误会改变后续状态、导致错误跨轮累积。作者在三个 Qwen3 模型(8B–235B)上的预实验发现,超过一半的失败 rollout 含有一个"关键错误"(pivotal mistake)——一个让智能体远离任务完成的动作,且通常发生在早期;但这些错误往往仍可恢复,只需在关键轮之后引导模型几轮即可恢复任务成功。

方法:PivotOPD 联合训练学生模型预防关键错误并从其造成的状态中恢复。在每个关键错误处,教师模型给出黄金动作并在随后几轮给出恢复动作:预防蒸馏用反向 KL 引导学生避开关键错误,恢复蒸馏用前向 KL 传递学生很少采样的恢复行为。

结果:在 ALFWorld、WebShop 和基于搜索的 QA 上,对比 13 个基线,PivotOPD 对 Qwen3-1.7B 和 Qwen3-8B 学生模型均取得最强平均性能。

所属事件:NVIDIA 发布 PivotOPD:教多轮智能体从关键失误中恢复(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →