MiniWorld: Democratizing the Training of Video World Models from Scratch
Yian Zhao, Ruochong Zheng, Hongcan Guo, Yu Yan, Jian Zhang, Jie Chen
cs.CV
2026-08-02
MiniWorld 用块因果视频扩散 Transformer 从零训练流式视频世界模型,单机 8 卡几天训完,在 DROID 上多项指标比双向短视频基线高一倍以上,代码权重全开。
视频世界模型(video world model)的任务,是根据历史画面和动作信号预测未来观测,用来支撑具身智能和可交互仿真。它和普通视频生成模型的区别在于:后者只学外观和运动,前者要学环境在智能体动作下演化的底层动力学。
此前主流做法是拿预训练好的双向视频扩散模型做后训练或蒸馏。双向预训练时模型能看到整段序列,推理时却是因果的、流式的,看不到未来,两者结构对不上。这套流程还依赖复杂的多阶段管线和大量算力。已有研究证明从零训练自回归视频世界模型可行且可扩展,但社区一直缺一个轻量、透明、完全可复现、能端到端跑起来的基线。
MiniWorld 在预训练视频 VAE 的潜空间里,用一个块因果(block-causal)视频扩散 Transformer 做训练,目标函数是 Flow Matching。块因果的含义是:同一个 chunk 内的 token 双向互相注意,跨 chunk 严格因果。这样既保留了 chunk 内丰富的时序交互,又强制了自回归依赖。
它建立在 Diffusion Forcing 之上,采用 chunk 级非递减噪声调度(τ₁ ≤ τ₂ ≤ … ≤ τₘ),保证更早的 chunk 始终比更晚的更干净,这恰好对应真实推理时的状态。作者把 Frame-oriented Probability Propagation 扩展到 chunk 级(CoPP),保持采样的均衡性。
训练分两阶段:先用 21/46 帧的短片段学局部的、动作驱动的动力学,再用 125/253 帧的长序列接触更长的因果上下文。推理时用滚动 KV 缓存加流水线异步去噪:完成的 chunk 进入先进先出缓存,未来的 chunk 异步去噪;RoPE 重排偏移让查询位置始终落在训练时见过的范围内。
在 DROID 和 RealEstate10K 两个数据集上,与归一化为 1 的双向短视频基线对比(相对提升):
| 指标 | DROID | RealEstate10K |
| 轨迹准确率 / 光度平滑度 | +249% | +89% |
| 深度准确率 | +238% | +55% |
| LPIPS | +216% | +27% |
| SSIM | +125% | +19% |
| PSNR | — | +34% |
| VLM 评判分数 | +63%78% | — |
推理效率上,把 32-chunk 全窗口换成 8-chunk 在飞窗口加 KV 缓存后,稳态输出吞吐从 3.31 FPS 提到 7.29 FPS(约 +220%),首个 chunk 的延迟从 74.0 秒降到 4.86 秒,缩减 15.2 倍。消融显示,去噪窗口从 32 缩到 8、KV 缓存从 24 缩到 6 chunk,质量基本不掉,外观和动态指标波动在 1% 以内。模型规模 MiniWorld-1B,单台 8 卡服务器几天可训完。
MiniWorld 的价值不在刷榜,在于给社区一个能从零复现的流式视频世界模型基线:全程因果、训练和推理对齐、算力门槛压到单机 8 卡几天。这意味着没有巨型预训练预算的组也能进场做视频世界模型研究,不必去适配昂贵的双向模型。它也用数据说明,从零训练这条路在不堆算力的前提下,质量也能大幅超过双向短视频基线。
作者自己把定位说得很清楚:这是基线,不是性能天花板。模型和数据规模相对前沿视频基础模型偏小,评测覆盖的世界动力学领域也有限。长程漂移虽比以往大幅减轻,但预测误差在长滚动里仍会累积,尤其是在复杂交互场景。从零训练能追到什么程度、在更大算力下能否保持这种性价比,这篇没有回答。