同一条路线换 3 个视角重渲染:WorldRover 用 UE 引擎产出 200 小时带深度与动作流的世界探索视频

WorldRover: A Scalable Synthetic Video Data Engine for World Exploration with Rich Annotations

Xiaojie Xu, Zhengyuan Lin, Runyi Li, Yihao Liu, Kaipeng Zhang, Yongtao Ge

cs.CV, cs.GR

2026-08-16

Alaya Lab 等机构用 Unreal Engine 离线渲染管线把 32 个美术场景走成长路线,同一路线可从第一/第三人称与 360 全景重渲染并换天气,产出 2190 万帧带度量深度、光流、长程点轨与动作流的数据集。

这篇在解决什么

训练世界模型(生成或重建可探索的世界)需要的监督信号不止 RGB:相机位姿、度量深度、长程对应关系,交互式模型还需要控制信号。真实拍摄的视频只有像素是准的,位姿要事后估计会漂移,遮挡下的对应关系靠算法匹配会失败。渲染可以把这些量直接给出来,但现有合成数据集各有缺口:有的只有多视角没有动作流(OmniX),有的是游戏录屏、动作词汇 450 多个但场景与光照不可控(WildWorld),很少有资源能在同一批帧上把深度、光流、点轨、动作全配齐,还支持换视角、换天气重放。

WorldRover 的切入点是把「一次探索」定义成一条可复用的世界空间轨迹,而不是一段成品视频。轨迹定了,就可以从任意视角、任意外观状态重新观测它。

方法

引擎(WorldRover-Engine)建立在 Unreal Engine 上,分编辑器侧与渲染侧:

关键能力是重放:同一条路线可以从第一人称(眼高相机沿轨迹)、第三人称(动画角色沿路走,跟随相机在后几米)与 360 全景(同一瞬间渲染六个 100 度视场的立方体面,拼成 4096×2048 等距柱状视频)三种视角渲染,也可以换成另一天气状态、或整体换中性白材质。路线、时序、场景几何全程保持,所以这些变体是像素级对齐的对照数据。

标注直接从渲染器拿真值:度量深度(0.1 至 200 米,对数量化 16 位)、逐帧相机内外参、从渲染器速度缓冲导出的稠密光流、几何投影(而非匹配)得到的长程 2D/3D 点轨及可见性。第三人称子集还单独给角色轨迹,它与相机轨迹是真不同的运动:角色在转身时跟随相机只保持方位角。动作流是从运动反推的控制表示:相邻帧速度差分解到第一人称相机坐标系的前进/横移/转向/垂直四轴,量化后在数值变化时写出。

结果

当前发布的数据集 WorldRover-10M(名字指 1,080 万第一人称帧):

视角序列数帧数时长数据量
第一人称2,91010.8M100.5h5.9TB
第三人称1,8858.3M76.5h4.4TB
360 全景1,2082.8M25.8h8.4TB
合计6,00321.9M202.7h18.65TB

来自 32 个环境,70 多个动画角色(人形、四足、鸟类)。常规视角 1280×720,全景 4096×2048。中位序列时长:规划器路线 115 秒,路径点 105 秒,反应式 81 秒。场景分布上城市类 2,128 条、古镇/年代类 1,668 条为最大两块。

论文没有下游训练实验。作者在结尾直接写明:这篇报告描述管线与数据本身,不带下游结果,下一步是在发布的数据上训练并在标准 benchmark 上测量。

为什么重要

对做世界模型、视频生成、深度/光流/点跟踪任一方向的人,这是一个监督信号配齐且几何上一致的训练源。同一条路线的跨视角、跨天气重放,天然构成多任务对照:同一世界在不同观测条件下应该保持一致,这正好约束「世界一致性」本身。白材质变体还给了粗到精结构控制的现成配对。动作流是四轴量化的简单格式,对齐了交互式世界模型(输入前进/转向指令的那种)常见的控制接口。

也要诚实:这是一份数据集报告,没有一行下游数字来证明这些帧训出来的模型更好。价值大小取决于后续训练结果,现在下结论为时尚早。

局限与存疑

作者自述三条,都很实:

再补一条:动作流是从轨迹反推的控制表示,不是当时的真实输入日志,「重建出的动作」与「玩家真实操作」之间的分布差异没有被讨论,拿它做动作条件生成时要留意。

术语

原文与代码

相关论文

全部论文解读