NVIDIA 发布 PivotOPD:教多轮智能体从关键失误中恢复
NVIDIA 发布新论文 PivotOPD,针对策略蒸馏训练多轮智能体时的关键失误问题:交互中早期错误会改变后续状态并不断累积。对三个 Qwen3 模型(8B235B)的预实验显示,超过一半的失败轨迹包含此类关键失误,而 PivotOPD 让智能体学会预防并挽回失误,在 ALFWorld 基准上性能提升 5.5%。
2026-10-01 ~ 2026-10-01 · 2 条相关
- NVIDIA PivotOPD:教会智能体预防并挽回关键失误,ALFWorld +5.5% — nvidia · 2026-10-01
- NVIDIA 论文 PivotOPD:教多轮智能体从早期关键错误中恢复 — MohitIyyer · 2026-10-01