中科院论文梳理基础模型长程规划的形成与蒸馏机制
CASIA · hf · 2026-07-28
这篇论文研究什么
这篇工作讨论的是:基础模型智能体的多轮长程规划能力究竟如何获得、如何被后训练塑形,以及如何在多教师蒸馏中整合。
主要结论
- 作者构建了一个可控的多轮环境,把长程规划拆成三个阶段来研究:预训练、后训练(GRPO/OPD)、以及多教师 on-policy 蒸馏(MOPD)。
- 在预训练阶段,显式构建世界模型、用 CoT 状态转移建模,比直接动作预测更有利于长程泛化。
- 只有原子技能不足以支持组合泛化,但少量长程数据就能明显改善能力。
- 质量较差的轨迹会严重拖累性能,因为长程任务里错误会不断累积并放大。
- 在后训练阶段,作者用互信息区分了“通用规划模式”和“任务特定规划知识”。
- 论文指出后训练在不同情境下存在“不需要 / 有效 / 不支持”三个区域,并发现 OPD 在低质量、长程场景下的有效范围比 GRPO 更广,因为更新方向更稳定。
- 当教师带来的是学生原本不具备的流程知识时,蒸馏可能会削弱原有世界模型,却又没能完整建立新知识。
- MOPD 能通过收敛到共享规划模式来整合能力:兼容模式利于跨环境泛化,部分共享模式利于持续学习,完全冲突的模式则会造成严重干扰。
「研究」频道最新
- HumanLayer 认为,编程智能体需要完整软件工厂闭环 — AxSaucedo · 2026-07-28
- 研究发现 Hugging Face 图像编辑模型可轻易生成露骨深伪 — Wired AI · 2026-07-28
- Reddit 用户用 LoRA 和 ComfyUI 做出 Wan 2.2 连续生成流程 — SnooMacaroons1365 · 2026-07-28
- Kimi K3 复现 RLVR 研究结论且不乱下结论 — infoxiao · 2026-07-28
- 首个机器人三视角世界模型榜单 TriWorldBench 发布 — 机器之心 · 2026-07-28
- Lean 形式化证明了 Feige 猜想的 $\delta\ge 1$ 情形 — RexDouglass · 2026-07-28