NVIDIA 提出 PivotOPD:让多轮智能体学会从关键错误中恢复
NVIDIAAI · x · 2026-10-08
NVIDIA 研究团队发布 PivotOPD,一个针对多轮语言智能体的 on-policy 蒸馏框架。核心发现:在三个 Qwen3 模型(8B–235B)的实验中,超过一半的失败轨迹源于一个早期「关键错误」(pivotal mistake),且该错误通常发生在任务早期、事后仍可挽回。方法:训练时由教师模型在关键错误处给出正确动作,并示范之后几步如何回到正轨,让学生在「预防关键错误」与「从错误状态恢复」两方面同时学习。结果:在 ALFWorld、WebShop 和搜索式 QA 上对 13 个基线取得最佳平均成绩,并能迁移到 SWE-Bench Verified。代码即将开源。
「编程与Agent」频道最新
- GraphRAG 增量更新漏洞:删除的文档仍留在索引中可被检索 — JeremyCMorgan · 2026-10-08
- 论文:Vibe Coding 正在杀死开源,被推荐组件 Star 反跌 — soumitrashukla9 · 2026-10-08
- Every 发布 Compound Engineering 权威指南:让代码库越写越容易 — every · 2026-10-08
- Claude Haiku 5.5 发布:与 GPT-6 Luna 同价,但暗藏 token 膨胀 — Simon Willison · 2026-10-08
- 实测 Haiku 5.5 替代 Opus 跑浏览器测试:漏一项但性价比突出 — kevinkern · 2026-10-08
- Agent 测试游戏时在会议中自动启动,音乐响了 15 秒 — Aizkmusic · 2026-10-08