WorldWeaver 给多智能体视频扩散加上共享世界状态
Sicheng Mo · hf · 2026-07-24
WorldWeaver 用“世界状态寄存器”做多智能体视频扩散
这篇论文提出 WorldWeaver(W²),一个面向多智能体的流式自回归视频扩散模型,重点解决“共享世界状态”如何在多个 agent、多个视角之间持续保持的问题。
作者认为,现有视频扩散管线通常只是把历史帧当作条件上下文往后喂,这样很难形成真正可共享、可演化的世界状态。WorldWeaver 的做法是加入 cross-agent world-state registers,也就是一组可学习 token,用来:
- 存储共享世界信息
- 跟踪每个 agent 的状态
- 在每个生成 chunk 之后动态更新
这些寄存器通过个体状态、全局鸟瞰视角和场景文本来监督。模型架构上还用了一个 Mixture-of-Transformers 设计,把世界状态建模和视觉帧建模分开。作者在双人 Minecraft 视频生成上做实验,结果显示逻辑一致性和生成质量都有提升。
「多模态」频道最新
- Gen-1 演示里手部变形后仍完成动作 — E0M · 2026-07-24
- Instagram 的 Edits 应用新增了站内视频生成功能 — chrisfirst · 2026-07-24
- KREA 2 Turbo 风格画廊展示多种图像输出 — xMaybeIamALion · 2026-07-24
- BigMac 用嵌套流水线提速多模态训练最高 1.9 倍 — 机器之心 · 2026-07-24
- Flux 3 片段引发梗图式反应:“BROTHER PETER'S CHOIR” — cocktailpeanut · 2026-07-24
- Reddit 用户用 RTX 5070 Ti 训练出首个 Krea2 风格 LoRA — y3kdhmbdb2ch2fc6vpm2 · 2026-07-24