WorldWeaver 给多智能体视频扩散加上共享世界状态

Sicheng Mo · hf · 2026-07-24

WorldWeaver 用“世界状态寄存器”做多智能体视频扩散

这篇论文提出 WorldWeaver(W²),一个面向多智能体的流式自回归视频扩散模型,重点解决“共享世界状态”如何在多个 agent、多个视角之间持续保持的问题。

作者认为,现有视频扩散管线通常只是把历史帧当作条件上下文往后喂,这样很难形成真正可共享、可演化的世界状态。WorldWeaver 的做法是加入 cross-agent world-state registers,也就是一组可学习 token,用来:

这些寄存器通过个体状态、全局鸟瞰视角和场景文本来监督。模型架构上还用了一个 Mixture-of-Transformers 设计,把世界状态建模和视觉帧建模分开。作者在双人 Minecraft 视频生成上做实验,结果显示逻辑一致性和生成质量都有提升。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →