论文:长程规划需强化预训练与 OPD 后训练
rohanpaul_ai · x · 2026-08-25
针对 Agent 长任务可靠性差的问题,新论文指出仅靠后训练无法修复薄弱的长程基础,噪声轨迹会导致误差累积。研究提出,应在预训练阶段提供清晰的世界模型和长轨迹训练,并在奖励稀疏时使用 OPD(on-policy distillation)进行后训练。实验表明,OPD 比结果奖励 GRPO 更能处理长时噪声设置。
「编程与Agent」频道最新
- Qwen 27B 编程任务消耗 9 亿 Token,缓存机制大幅降低成本 — TheZachMueller · 2026-08-25
- Grok Build v1.0.9 升级:支持并发 Agent 与图片反馈 — XFreeze · 2026-08-25
- 开发者分享用 LLM 生成代码做 RL 可视化的工作流 — jsuarez · 2026-08-25
- cdisc-mcp:通过 CDISC API 暴露临床研究标准数据的 MCP 工具 — modelcontextprotocol · 2026-08-25
- 把 60GB 旧工作数据喂给 AI,建成可查询的「第二大脑」 — oilmutt · 2026-08-25
- GPT 5.6 疯狂过度设计,一句 80/20 提示砍掉九成代码量 — robleclerc · 2026-08-25