WorldWeaver 给多智能体视频扩散加上共享世界状态
Sicheng Mo · hf · 2026-07-24
WorldWeaver 用“世界状态寄存器”做多智能体视频扩散
这篇论文提出 WorldWeaver(W²),一个面向多智能体的流式自回归视频扩散模型,重点解决“共享世界状态”如何在多个 agent、多个视角之间持续保持的问题。
作者认为,现有视频扩散管线通常只是把历史帧当作条件上下文往后喂,这样很难形成真正可共享、可演化的世界状态。WorldWeaver 的做法是加入 cross-agent world-state registers,也就是一组可学习 token,用来:
- 存储共享世界信息
- 跟踪每个 agent 的状态
- 在每个生成 chunk 之后动态更新
这些寄存器通过个体状态、全局鸟瞰视角和场景文本来监督。模型架构上还用了一个 Mixture-of-Transformers 设计,把世界状态建模和视觉帧建模分开。作者在双人 Minecraft 视频生成上做实验,结果显示逻辑一致性和生成质量都有提升。
所属事件:WorldWeaver引入共享世界状态寄存器(2 条相关)→
「多模态」频道最新
- 3D ResNet 论文八年突破 3000 引用,Kinetics 数据集成里程碑 — HirokatuKataoka · 2026-09-11
- 零编程经验者用 ChatGPT 开发 ComfyUI 安卓客户端将上架 — ComfierUI · 2026-09-11
- FastH3-Live 升至 22fps:加速节点实测与 ComfyUI 显存避坑 — spartong945 · 2026-09-11
- Midjourney 风格参考分享:--sref 2912175708 — tisch_eins · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11
- Hailuo 转推:MiniMax H3 MAX 一发生成 15 秒美食动画短片 — Hailuo_AI · 2026-09-11