NVIDIA PivotOPD:教会智能体预防并挽回关键失误,ALFWorld +5.5%
nvidia · hf · 2026-10-01
NVIDIA 提出在策略蒸馏训练智能体的关键失误问题:多轮交互中错误会改变后续状态并累积。对三个 Qwen3 模型(8B235B)的预实验发现,过半失败轨迹含'关键失误'——一个使智能体偏离任务的动作,且通常发生在早期,但多数仍可挽回:关键轮之后教师只需引导几轮即可恢复成功。
PivotOPD 同时训练预防与恢复:预防蒸馏用黄金动作+reverse KL,恢复蒸馏在随后几轮用教师恢复动作+forward KL。对 13 个基线,Qwen3-1.7B 与 8B 在 ALFWorld、WebShop、搜索 QA 上平均表现最强,ALFWorld 上 1.7B 学生提升 5.5%;跨家族迁移到软件工程,Nemotron-3.5 学生在 SWE-Bench Verified 解决率提升 3.2%。
「编程与Agent」频道最新
- 开源 Hybris MCP Server 让 AI 助手直接管理 SAP Commerce Cloud — modelcontextprotocol · 2026-10-01
- CMU 发布 cua-speedrun:同分下 computer-use agent 速度差距可达 4.4 倍 — arankomatsuzaki · 2026-10-01
- 开源 M-Anchor:零 LLM 调用的确定性 Python 网关拦截越权记录更新 — Informal-Winter-3190 · 2026-10-01
- 不用 Fable 纯跑 Opus 4.5,不到两天烧完 Claude 周额度 — yihui_indie · 2026-10-01
- 双模型分工实操:Opus 管架构审查,Sol 负责大量编码 — haider1 · 2026-10-01
- 形式化验证专家批 AI 圈认知落后 15 年:现代 FV 不靠 SMT 与翻译器 — tianyin_xu · 2026-10-01