论文:长程规划需强化预训练与 OPD 后训练

rohanpaul_ai · x · 2026-08-25

针对 Agent 长任务可靠性差的问题,新论文指出仅靠后训练无法修复薄弱的长程基础,噪声轨迹会导致误差累积。研究提出,应在预训练阶段提供清晰的世界模型和长轨迹训练,并在奖励稀疏时使用 OPD(on-policy distillation)进行后训练。实验表明,OPD 比结果奖励 GRPO 更能处理长时噪声设置。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →