NVIDIA 发布 PivotOPD:教多轮智能体从关键失误中恢复

NVIDIA 发布新论文 PivotOPD,针对策略蒸馏训练多轮智能体时的关键失误问题:交互中早期错误会改变后续状态并不断累积。对三个 Qwen3 模型(8B235B)的预实验显示,超过一半的失败轨迹包含此类关键失误,而 PivotOPD 让智能体学会预防并挽回失误,在 ALFWorld 基准上性能提升 5.5%。

2026-10-01 ~ 2026-10-01 · 2 条相关