WorldRover: A Scalable Synthetic Video Data Engine for World Exploration with Rich Annotations
Xiaojie Xu, Zhengyuan Lin, Runyi Li, Yihao Liu, Kaipeng Zhang, Yongtao Ge
cs.CV, cs.GR
2026-08-16
Alaya Lab 等机构用 Unreal Engine 离线渲染管线把 32 个美术场景走成长路线,同一路线可从第一/第三人称与 360 全景重渲染并换天气,产出 2190 万帧带度量深度、光流、长程点轨与动作流的数据集。
训练世界模型(生成或重建可探索的世界)需要的监督信号不止 RGB:相机位姿、度量深度、长程对应关系,交互式模型还需要控制信号。真实拍摄的视频只有像素是准的,位姿要事后估计会漂移,遮挡下的对应关系靠算法匹配会失败。渲染可以把这些量直接给出来,但现有合成数据集各有缺口:有的只有多视角没有动作流(OmniX),有的是游戏录屏、动作词汇 450 多个但场景与光照不可控(WildWorld),很少有资源能在同一批帧上把深度、光流、点轨、动作全配齐,还支持换视角、换天气重放。
WorldRover 的切入点是把「一次探索」定义成一条可复用的世界空间轨迹,而不是一段成品视频。轨迹定了,就可以从任意视角、任意外观状态重新观测它。
引擎(WorldRover-Engine)建立在 Unreal Engine 上,分编辑器侧与渲染侧:
关键能力是重放:同一条路线可以从第一人称(眼高相机沿轨迹)、第三人称(动画角色沿路走,跟随相机在后几米)与 360 全景(同一瞬间渲染六个 100 度视场的立方体面,拼成 4096×2048 等距柱状视频)三种视角渲染,也可以换成另一天气状态、或整体换中性白材质。路线、时序、场景几何全程保持,所以这些变体是像素级对齐的对照数据。
标注直接从渲染器拿真值:度量深度(0.1 至 200 米,对数量化 16 位)、逐帧相机内外参、从渲染器速度缓冲导出的稠密光流、几何投影(而非匹配)得到的长程 2D/3D 点轨及可见性。第三人称子集还单独给角色轨迹,它与相机轨迹是真不同的运动:角色在转身时跟随相机只保持方位角。动作流是从运动反推的控制表示:相邻帧速度差分解到第一人称相机坐标系的前进/横移/转向/垂直四轴,量化后在数值变化时写出。
当前发布的数据集 WorldRover-10M(名字指 1,080 万第一人称帧):
| 视角 | 序列数 | 帧数 | 时长 | 数据量 |
| 第一人称 | 2,910 | 10.8M | 100.5h | 5.9TB |
| 第三人称 | 1,885 | 8.3M | 76.5h | 4.4TB |
| 360 全景 | 1,208 | 2.8M | 25.8h | 8.4TB |
| 合计 | 6,003 | 21.9M | 202.7h | 18.65TB |
来自 32 个环境,70 多个动画角色(人形、四足、鸟类)。常规视角 1280×720,全景 4096×2048。中位序列时长:规划器路线 115 秒,路径点 105 秒,反应式 81 秒。场景分布上城市类 2,128 条、古镇/年代类 1,668 条为最大两块。
论文没有下游训练实验。作者在结尾直接写明:这篇报告描述管线与数据本身,不带下游结果,下一步是在发布的数据上训练并在标准 benchmark 上测量。
对做世界模型、视频生成、深度/光流/点跟踪任一方向的人,这是一个监督信号配齐且几何上一致的训练源。同一条路线的跨视角、跨天气重放,天然构成多任务对照:同一世界在不同观测条件下应该保持一致,这正好约束「世界一致性」本身。白材质变体还给了粗到精结构控制的现成配对。动作流是四轴量化的简单格式,对齐了交互式世界模型(输入前进/转向指令的那种)常见的控制接口。
也要诚实:这是一份数据集报告,没有一行下游数字来证明这些帧训出来的模型更好。价值大小取决于后续训练结果,现在下结论为时尚早。
作者自述三条,都很实:
再补一条:动作流是从轨迹反推的控制表示,不是当时的真实输入日志,「重建出的动作」与「玩家真实操作」之间的分布差异没有被讨论,拿它做动作条件生成时要留意。