WorldGuide:闭环任务执行的定向视频世界模型,胜 MiniMax-H3
MBZUAI · hf · 2026-10-09
- MBZUAI 提出 WorldGuide,把程序化视频生成建模为视觉世界空间中的闭环任务执行:仅凭初始图像与任务目标,模型预测原子动作、生成对应视频片段,并根据生成结果选择下一步动作或终止。
- Planner 与 Executor 用同一批 step 级程序化演示训练:Planner 从视觉进度预测下一原子动作或任务完成,Executor 直接学习实现预测动作;分层视觉记忆以有界历史 token 成本维持长程状态。
- 由于缺乏 step 级动作-视频联合监督,团队构建 WorldGuide Bench(245 个任务、27 个程序化类别、约 59K 条 step 标注视频)。WorldGuide 在该基准任务成功率达 33.33%(MiniMax-H3 为 29.90%,且后者还拿到了参考动作计划);在 VideoCraft-Bench 仅凭目标条件下达 47.69% 对 MiniMax-H3 的 32.73%,显示规划与学习执行耦合的重要性。
「研究」频道最新
- PersistBench 登 NeurIPS Spotlight:4D 基础模型其实不太有视觉记忆 — weichiuma · 2026-10-09
- StarkWare 创始人:AI 解出 Erdős 单位距离问题后,数学证明已不可预测 — jamestagg · 2026-10-09
- Claude Science 生成首张完整紫外全天图,预测偏差仅约 10% — The Decoder · 2026-10-09
- FreeMatching:突破时空先验的图像编辑稠密对应匹配框架 — hkuhk · 2026-10-09
- REMORY:用软记忆 token 补全上下文压缩,仅 5.2% 输入逼近全上下文 — Hanchen Xia · 2026-10-09
- OpenAI 纳维-斯托克斯证明引 $5000 对赌,2027 年见分晓 — ctjlewis · 2026-10-09