单机8卡训视频世界模型,北大开源MiniWorld框架
PekingUniversity · hf · 2026-08-05
北京大学开源了 MiniWorld,一个从零开始训练流式视频世界模型(Video World Models)的轻量级框架。
- 核心痛点:当前视频世界模型多依赖预训练的视频生成模型进行后训练或蒸馏,流程复杂且算力消耗大,且存在双向预训练与因果流式推理不匹配的问题。
- 架构方法:采用块因果视频扩散Transformer(Block-causal Video Diffusion Transformer),在预训练 Video VAE 的潜空间中进行流匹配(Flow Matching)训练。基于 Diffusion Forcing,引入分块非递减噪声调度和两阶段连续训练,提升时序建模稳定性。
- 推理优化:结合滚动 KV 缓存与流水线异步去噪,在有限算力下实现高效的流式生成。
- 算力门槛:整个模型端到端训练仅需单台 8-GPU 服务器,数天内即可完成。项目已开源代码与预训练权重,旨在为社区提供透明、可复现的基线方案。
「多模态」频道最新
- MiniMax 视频模型实测:用 4 张图生成汤姆·赫兰德吃街头小吃 — CurieuxExplorer · 2026-08-05
- MiniMax H3 开启早访:主打多模态生成与精准场景编辑 — HeyAmit_ · 2026-08-05
- SandAI 发布 114B 音视频生成模型 MAGI-2 预览版 — Nice_Amphibian_8367 · 2026-08-05
- Seedance 2.5 视频模型上线,支持 30 秒原生生成与多模态参考 — HeyNayeem · 2026-08-05
- Seedance 2.5 上线 Lumina AI:支持单次生成 30 秒视频 — HeyNayeem · 2026-08-05
- MiniMax H3 视频生成耗时基准:越长视频每单位耗时越高 — madcaddie15 · 2026-08-05