从零训视频世界模型:MiniWorld 单机 8 卡几天跑通,附可复现代码与权重

MiniWorld: Democratizing the Training of Video World Models from Scratch

Yian Zhao, Ruochong Zheng, Hongcan Guo, Yu Yan, Jian Zhang, Jie Chen

cs.CV

2026-08-02

MiniWorld 用块因果视频扩散 Transformer 从零训练流式视频世界模型,单机 8 卡几天训完,在 DROID 上多项指标比双向短视频基线高一倍以上,代码权重全开。

这篇在解决什么

视频世界模型(video world model)的任务,是根据历史画面和动作信号预测未来观测,用来支撑具身智能和可交互仿真。它和普通视频生成模型的区别在于:后者只学外观和运动,前者要学环境在智能体动作下演化的底层动力学。

此前主流做法是拿预训练好的双向视频扩散模型做后训练或蒸馏。双向预训练时模型能看到整段序列,推理时却是因果的、流式的,看不到未来,两者结构对不上。这套流程还依赖复杂的多阶段管线和大量算力。已有研究证明从零训练自回归视频世界模型可行且可扩展,但社区一直缺一个轻量、透明、完全可复现、能端到端跑起来的基线。

方法

MiniWorld 在预训练视频 VAE 的潜空间里,用一个块因果(block-causal)视频扩散 Transformer 做训练,目标函数是 Flow Matching。块因果的含义是:同一个 chunk 内的 token 双向互相注意,跨 chunk 严格因果。这样既保留了 chunk 内丰富的时序交互,又强制了自回归依赖。

它建立在 Diffusion Forcing 之上,采用 chunk 级非递减噪声调度(τ₁ ≤ τ₂ ≤ … ≤ τₘ),保证更早的 chunk 始终比更晚的更干净,这恰好对应真实推理时的状态。作者把 Frame-oriented Probability Propagation 扩展到 chunk 级(CoPP),保持采样的均衡性。

训练分两阶段:先用 21/46 帧的短片段学局部的、动作驱动的动力学,再用 125/253 帧的长序列接触更长的因果上下文。推理时用滚动 KV 缓存加流水线异步去噪:完成的 chunk 进入先进先出缓存,未来的 chunk 异步去噪;RoPE 重排偏移让查询位置始终落在训练时见过的范围内。

结果

在 DROID 和 RealEstate10K 两个数据集上,与归一化为 1 的双向短视频基线对比(相对提升):

指标DROIDRealEstate10K
轨迹准确率 / 光度平滑度+249%+89%
深度准确率+238%+55%
LPIPS+216%+27%
SSIM+125%+19%
PSNR+34%
VLM 评判分数+63%78%

推理效率上,把 32-chunk 全窗口换成 8-chunk 在飞窗口加 KV 缓存后,稳态输出吞吐从 3.31 FPS 提到 7.29 FPS(约 +220%),首个 chunk 的延迟从 74.0 秒降到 4.86 秒,缩减 15.2 倍。消融显示,去噪窗口从 32 缩到 8、KV 缓存从 24 缩到 6 chunk,质量基本不掉,外观和动态指标波动在 1% 以内。模型规模 MiniWorld-1B,单台 8 卡服务器几天可训完。

为什么重要

MiniWorld 的价值不在刷榜,在于给社区一个能从零复现的流式视频世界模型基线:全程因果、训练和推理对齐、算力门槛压到单机 8 卡几天。这意味着没有巨型预训练预算的组也能进场做视频世界模型研究,不必去适配昂贵的双向模型。它也用数据说明,从零训练这条路在不堆算力的前提下,质量也能大幅超过双向短视频基线。

局限与存疑

作者自己把定位说得很清楚:这是基线,不是性能天花板。模型和数据规模相对前沿视频基础模型偏小,评测覆盖的世界动力学领域也有限。长程漂移虽比以往大幅减轻,但预测误差在长滚动里仍会累积,尤其是在复杂交互场景。从零训练能追到什么程度、在更大算力下能否保持这种性价比,这篇没有回答。

术语

原文与代码

相关论文

全部论文解读