NVIDIA 论文 PivotOPD:教多轮智能体从早期关键错误中恢复
MohitIyyer · x · 2026-10-01
新论文 PivotOPD: Learning to Recover from Pivotal Mistakes in Multi-Turn Agents(arXiv:2609.40285,作者含 Jan Kautz、Ali Hatamizadeh 等 NVIDIA 研究者)。
论文动机:在线策略蒸馏(OPD)训练语言智能体时,多轮交互中一个早期错误会改变后续状态、导致错误跨轮累积。作者在三个 Qwen3 模型(8B–235B)上的预实验发现,超过一半的失败 rollout 含有一个"关键错误"(pivotal mistake)——一个让智能体远离任务完成的动作,且通常发生在早期;但这些错误往往仍可恢复,只需在关键轮之后引导模型几轮即可恢复任务成功。
方法:PivotOPD 联合训练学生模型预防关键错误并从其造成的状态中恢复。在每个关键错误处,教师模型给出黄金动作并在随后几轮给出恢复动作:预防蒸馏用反向 KL 引导学生避开关键错误,恢复蒸馏用前向 KL 传递学生很少采样的恢复行为。
结果:在 ALFWorld、WebShop 和基于搜索的 QA 上,对比 13 个基线,PivotOPD 对 Qwen3-1.7B 和 Qwen3-8B 学生模型均取得最强平均性能。
所属事件:NVIDIA 发布 PivotOPD:教多轮智能体从关键失误中恢复(2 条相关)→
「编程与Agent」频道最新
- exe.dev 博客:别堆并发,用快模型沟通、少跑 agent — davidcrawshaw · 2026-10-01
- 开源编程模型 IQuest-Q1 上架 Hugging Face,可接 Claude Code 使用 — ZabihullahAtal · 2026-10-01
- IQuest-Q1 实测:一句需求生成可交互 SaaS 仪表盘 — ZabihullahAtal · 2026-10-01
- ParallelPilot 论文:并行编码智能体吞吐量提升 63% — erichorvitz · 2026-10-01
- Opus 5.5 连续工作 23 小时,把 Omarchy 桌面搬进 WSL — sytelus · 2026-10-01
- Runway 推出 Visual Thinking:实时视频模型可视化编码 Agent 每一步 — runwayml · 2026-10-01