NVIDIA 提出 PivotOPD:让多轮智能体学会从关键错误中恢复

NVIDIAAI · x · 2026-10-08

NVIDIA 研究团队发布 PivotOPD,一个针对多轮语言智能体的 on-policy 蒸馏框架。核心发现:在三个 Qwen3 模型(8B–235B)的实验中,超过一半的失败轨迹源于一个早期「关键错误」(pivotal mistake),且该错误通常发生在任务早期、事后仍可挽回。方法:训练时由教师模型在关键错误处给出正确动作,并示范之后几步如何回到正轨,让学生在「预防关键错误」与「从错误状态恢复」两方面同时学习。结果:在 ALFWorld、WebShop 和搜索式 QA 上对 13 个基线取得最佳平均成绩,并能迁移到 SWE-Bench Verified。代码即将开源。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →