SolarWM开源143万片段,5秒训练即可滚出小时级世界

SolarWM: Open Data and Scalable Training for Long-Horizon Video World Models

Junchao Huang, Guian Fang, Shengju Qian, Xianghao Kong, Zhuoran Zhao, Wei Huang, Yihua Du, Zixin Zhang, Justin Cui, Yuchao Gu, Yukang Chen, Xinting Hu, Tianyu He, Shaoshuai Shi, Zhuotao Tian, Xin Wang, Mike Zheng Shou, Li Jiang

cs.CV

2026-09-03

把十个异构视频源整理成一百四十三万条统一片段,再用同一套三阶段配方,把Wan、LTX、MiniMax做成可交互长程世界模型。

这篇在解决什么

交互式视频世界模型要根据相机运动或指令往前滚画面,把生成器变成可探索的环境。短片段生成已经能看,长程交互还卡两件事。数据侧,现有数据集的时长、相机约定、画质和字幕口径不一致,硬混会把监督搅乱。模型侧,视频生成器的隐空间、注意力和条件注入差得很远,为每个骨干单独搭一套训练栈,结果没法横向比。

开源系统往往只给权重或推理代码,缺处理好的数据、筛选记录和可复现配方。SolarWM要补的是整条可复现地基:数据引擎加跨骨干适配。

方法

数据引擎先把10个源(ABOT-World、DL3DV、MiraData、RealCam、SpatialVID、Sekai、MIND、MultiCamVideo、OmniWorld等)收成约143万条规范片段,物理体量25.85 TB。每条样本对齐到同一套帧级合同:画面、度量相机位姿、内参、稠密字幕、质量指标和来源谱系。源处理与训练配比拆开,换过滤阈值或源权重不必重跑相机估计和字幕。

相机标注按源走不同路径:纯视频用Pi3X加MoGe-2再进VIPE SLAM;已有COLMAP或真值位姿的,保留轨迹只对齐尺度。人车等动态物体会干扰相机可控训练,于是用LTX-2.3 Clean Plate再造三份干净场景,约54.3万条,作为独立可配比的数据源,不是偷偷替换原片。字幕由Kimi-K2.6统一写,只描述稳定环境,刻意不写相机运动,避免文本条件把控制信号泄漏进去。

模型侧在共享的相机条件、训练和推理接口下,实例化四条骨干:Wan2.2 5B/14B、LTX-2.5 22B、MiniMax-H3 33B。相机注入走fused-PRoPE,作用在现有自注意力的Q/K/V上,不加单独控制分支。训练三阶段,都只在5秒序列上做:

推理固定16 fps、4步采样,不用attention sink。

结果

实验几乎全是定性图。双向预训练后,四条骨干都能从GPT Image 2或Krea合成的域外首帧,跟着平移、旋转和6自由度轨迹滚出10秒。蒸馏后的Wan2.2-5B-fast因果学生,在OmniWorld、MiraData、Sekai-Game、MIND、ABOT、DL3DV的留出样本上做10秒和分钟级自回归;再用合成首帧做分钟级域外滚出;最后从真实首帧不中断滚到约60分钟。训练窗口只有5秒,评价时不重切短片、不灌参考帧、不加attention sink。

和同领域系统的对比主要在开源完整度,不在FID或相机误差表。SolarWM声称权重、推理、训练、25.85 TB/142.6万片段、完整筛选记录、可执行流水线和精确配方全部公开,并且覆盖4个骨干家族。对照里SANA-WM大约235 GB/1600片段,minWM大约527 GB/1.9万片段,多数系统缺训练代码或数据配方。

为什么重要

世界模型研究现在缺的是能复现、能换数据、能换骨干的公共栈。把源处理与配比拆开,后来者可以改过滤和采样,不必重跑25 TB预处理。三阶段配方刻意做短:作者认为算力应压在双向阶段,因果适配和DMD步数可以很少,长视频微调不是必需。

对要做相机可控漫游、游戏或具身仿真的团队,这更像一套可改的基础设施,而不是一张刷分表。

局限与存疑

正文实验没有给出FVD、相机轨迹误差、用户研究或与Genie/Yume/AlayaWorld的同协议数字对比,「SOTA」缺少可核对的排行榜。小时级结果靠稀疏抽帧展示,漂移、纹理崩溃和物体持久性没有定量口径。Clean Plate会引入伪影,字幕去掉动态实体,对人车交互不友好。控制信号主要是相机轨迹,不是键盘或机器人动作。开源表述用的是「将发布」,读者需要核对仓库是否已经落地。

术语

原文与代码

社区讨论

相关论文

全部论文解读