Building Pretraining Data for World Models: An Unreal Engine-Based Pipeline for Action-Conditioned Video Generation
Haoyu Wang, Songchun Zhang, Haoran Li, Haoyang Huang, Zeyue Xue, Nan Duan
cs.CV, cs.GR
2026-09-03
京东 Joy Future Academy 用 Unreal 两阶段流水线,在 25 台 8×RTX 5090 上从 2384 个资产包筛出 429 个关卡,产出 2691 小时 1080p 加 6076 小时 720p 的五机位动作对齐视频,供 EchoWM 预训练。
可交互世界模型要的不只是好看的视频,还要和画面逐帧对齐的控制信号。网上的视频视觉多样,但「这一帧为什么会变成下一帧」通常不可观测,动作得事后估。游戏回放有按键,又绑在特定作品上。Genie、GameNGen、Matrix-Game 3.0、DreamX-World、EchoWM 这类系统已经在往高分辨率、长时程、可操控走,数据引擎也越来越杂,合成 3D、玩法录像、互联网视频拼在一起。合成那一段常常只在模型论文里被顺口提一句。
这篇是 EchoWM 的 Unreal 合成数据生产报告,目标很具体:把市面上买来的异构 Fab 资产,变成带精确控制、多机位、物理成立的视频。动作由流水线生成,不事后反推;角色状态和相机位姿从引擎直接记。
卡点是引擎自己的执行模型。角色要撞墙、受重力、爬坡,必须在运行时把物理跑完;高质量画面靠 Movie Render Queue(MRQ)离线渲染,时间轴按帧反复求值,和实时物理拧不到一起。同一进程里边模拟边抓图,抗锯齿稳不住。所以生产必须拆开。
两阶段是引擎约束逼出来的,不是建模偏好。
动作空间是 9 个离散状态:W/A/S/D 及四个斜向组合,外加 IDLE。标准轨迹 1800 帧、60 秒,同步五路相机(后随、左右侧、俯视、近头第一人称)。外相机用角色相对偏移,遮挡时沿角色到相机的射线往里收,收缩快、回弹慢,避免窄物体造成画面弹跳。动作按预设分布抽样并保持一段随机帧数,减少每帧乱换向的抖动;用兴趣点慢慢转朝向来扩大空间覆盖,卡死则大角度逃脱,反复失败就换点重生。
资产从 Fab 批量买,2384 个包先自动扫目录,丢掉独立打开不完整的子关卡、橱窗摆放关和依赖分区加载的超大开放世界。可渲染性用五条 10 秒 540p 片段人工看:崩溃、没有可行走区、悬浮、严重穿模的关卡关掉。视觉过滤借用 SpatialVID 的审美分和亮度分,单机位 aes>5.5 且 25<lum<140 算通过,一个关卡要有超过 25% 的抽样片段过线才进生产。角色还要单独标定九个动作的动画、碰撞盒、朝向修正和行走/飞/游模式。
集群是 25 台、每台 8 张 RTX 5090。中心分配器只做关卡池的粗分配,节点本地管槽位生命周期。关卡按节点数切成持久池,重复渲染同一批场景,好复用着色器和纹理缓存;冷启动单场景可超过十分钟,池化后反复访问的场景渲染时间不到冷启动一半。槽位在 GPU 上超配,因为单进程经常卡在加载和编译,不会一直打满卡。完成用追加进度日志做单向通信,崩溃后只保留「有完成标记且视频文件齐」的轨迹。上传和渲染解耦,失败快照单独归档。
这是生产报告,没有下游世界模型的对照表。规模如下。
| 项目 | 数值 |
| 购入 Fab 包 / 保留关卡 | 2384 / 429 |
| 人形角色 / 同步机位 | 40 / 5 |
| 1080p / 720p 产出 | 2691 小时 / 6076 小时 |
| 五机位吞吐 | 33 分钟 / 节点小时 |
| 斜向+后退+侧向动作占比 | 46.6% |
历史奇幻、科幻、自然、城市建筑四类大约各占 19%–29%,没有被单一场景类型吞掉。审美和亮度阈值是经验选的,没有对下游世界模型效用做过校准。
世界模型竞赛正在从「再堆一个生成架构」转到「动作-画面-相机能不能对得上」。这篇把合成数据从模型附录里拆出来,写成可复现的生产系统:物理和渲染为什么必须拆、缓存局部性怎么调度、第三方资产的电影序列和纹理流怎么清洗。做交互世界模型或具身数据引擎的人,可以直接抄这套合同式两阶段,不必从 SceneCapture 抗锯齿翻车再走一遍。
它不证明这些数据能把某个世界模型抬多少。EchoWM 才是用数的那篇。读这篇是为了知道 8700 小时是怎么来的,以及哪些过滤其实还没和训练指标对齐。
作者写得很直。流水线在可控性、动作多样性、物理成立、画面质量和吞吐之间做妥协,不是为电影级画面优化。审美分和亮度分能丢掉全黑、过曝、空镜头,但观感和「对学环境动力学有没有用」不是一回事,阈值没拿下游实验校准,滤太狠会丢掉结构多样的丑场景。动作库仍是走、停、转,没有跳、跑、爬、攻击或复杂交互。较新的实现在改相机坐标系动作(前进等于往画面深处走),这篇主要报告的仍是角色坐标系。第三方资产自带碰撞和电影镜头坑,可渲染性仍要人工看 540p 小片,这一步没完全自动化。