NVIDIA PivotOPD:教会智能体预防并挽回关键失误,ALFWorld +5.5%

nvidia · hf · 2026-10-01

NVIDIA 提出在策略蒸馏训练智能体的关键失误问题:多轮交互中错误会改变后续状态并累积。对三个 Qwen3 模型(8B235B)的预实验发现,过半失败轨迹含'关键失误'——一个使智能体偏离任务的动作,且通常发生在早期,但多数仍可挽回:关键轮之后教师只需引导几轮即可恢复成功。

PivotOPD 同时训练预防与恢复:预防蒸馏用黄金动作+reverse KL,恢复蒸馏在随后几轮用教师恢复动作+forward KL。对 13 个基线,Qwen3-1.7B 与 8B 在 ALFWorld、WebShop、搜索 QA 上平均表现最强,ALFWorld 上 1.7B 学生提升 5.5%;跨家族迁移到软件工程,Nemotron-3.5 学生在 SWE-Bench Verified 解决率提升 3.2%。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →