Game2World Engine: Unlocking In-the-Wild Gameplay Videos for World Model Training
Wenxuan Shen, Dongna Jin, Dongping Chen
cs.CV
2026-08-25
网上的游戏录像混着血条、小地图和主播水印,不能直接当世界模型数据。G2WEngine抽出5132个HUD资产合成9.6万对;GameCleaner无mask去界面,合成集AAR 95.36,洗净后微调Wan,VideoReward涨6.83%。
网上的游戏录像看起来像现成的世界模型数据:场景多、交互乱、轨迹也长。下载下来的却是一张合成画面。血条、小地图、任务提示、击杀播报、主播摄像头和水印全叠在屏幕空间里,不属于游戏世界,却会进训练信号。
同一批 5442 条干净片段,一份保持原样,一份用引擎叠上合成 HUD,再分别微调 Wan-2.1-T2V-1.3B。干净数据把生成视频的 VideoReward 整体分抬了 6.83%,运动质量一项高 18.8%。清晰度反而掉 1.43%,因为 HUD 上的锐利文字会被清晰度指标加分。
问题不是游戏视频太少,是界面和世界缠在一起。这篇把拆开做成一条可扩展的数据工序。
整条链路叫 G2WEngine,四步走完。
合成集 Game2World-S 有 9.6 万对。野外集 Game2World-W 是 1079 条真实 5 秒片段,来自同样 303 款游戏,没有干净底片;第一帧用 GPT-5.6 Sol 标,动态元件再逐帧人工改。
去界面模型叫 GameCleaner,推理时不吃 mask。骨干跟 Kiwi-Edit 一样:多模态大模型编码源视频和「去掉 HUD」指令,可学习 query 抽出语义条件灌进视频 DiT;源视频的 VAE latent 以随时间步变化的残差接回,免得把场景改丢。MLLM 和连接器冻结,只对 DiT 打 rank-64 的 LoRA,flow matching 训 3000 步,8 张 H100,全局 batch 32,学习率 1e-4,分辨率 720p。带参考图的变体训练时随机丢掉 20% 干净参考,测试时可以给一张干净帧,也可以不给。
Pilot 里干净数据微调后的 VideoReward:视频质量 -0.643、运动质量 -0.298、时间对齐 1.008、总分 0.068;叠界面对照是 -0.661、-0.367、1.018、-0.009。美学分 6.109 对 5.626,运动一致性 16.392 对 15.706。
去 HUD 评测用 MLLM 当裁判,抽 2 FPS 关键帧。人工对齐在 200 条视频、6150 个元件标签上,removed F1 87.78%,Cohen's κ 0.820。核心指标 AAR 按伪影打折:清干净且无伪影记 1.0,有轻微伪影 0.5,没去掉或不确定记 0。BG 看框外场景有没有被改。
| 方法 | 合成 AAR / BG | 野外 AAR / BG | Overall |
| VACE-1.3B(有 mask) | 59.11 / 96.50 | 30.40 / 91.45 | 69.37 |
| EffectErase(有 mask) | 56.17 / 84.45 | 23.55 / 74.55 | 59.68 |
| Aurora(无 mask) | 60.62 / 24.45 | 51.19 / 14.00 | 37.57 |
| Kiwi-Edit(无 mask) | 34.68 / 97.30 | 13.54 / 96.80 | 60.58 |
| GameCleaner | 95.36 / 99.00 | 48.56 / 99.60 | 85.63 |
| GameCleaner(带参考) | 94.64 / 98.85 | 80.05 / 99.80 | 93.34 |
合成集上,相对最强无 mask 基线 Aurora 的 60.62 AAR,GameCleaner 高出 57.3%。EffectErase 的原始「去掉了」分数很高(合成 94.56、野外 92.00),AAR 和 BG 却掉下去,旁边的场景经常被一起改掉。带参考的 GameCleaner 野外 Track-Clean 68.12,EffectErase 只有 16.12。
参考图 20% dropout 最合适:野外 AAR 从 0% 时的 70.64 升到 80.05,50% 和 80% 掉到 56.23 和 54.64。训练数据从 60% 加到 100%,合成 AAR 只多 2.06,野外 AAR 多 25.09。合成已经接近饱和,野外还在吃多样性。
Genie、GameGen-X、MineWorld 这类系统,训练时基本把渲染帧当成世界观测。网上的实况录像量级远大于能插桩的模拟器,这条路一直被 HUD 卡住。这篇把洗界面做成可并行的片段级工序,不再给每款游戏单独写一份编辑脚本。
对要拿游戏视频训世界模型的人,结论很具体:先把界面拿掉,运动质量和美学分才会朝对的方向动;只看「UI 还在不在」会高估那些乱改背景的编辑模型。GameCleaner 不需要画 mask,跨 303 款未见布局也能跑。代码、数据和模型声称会放到 GitHub。
这是数据工程上的一步,不是新的世界模型结构。下游验证还停在文本条件的视频生成代理上。
作者自己写了几条硬的。Game2World 还没覆盖游戏、界面和录制条件的完整分布;大块不透明面板、快速闪动的叠加层、和场景纹理缠在一起的元件,重建会糊。下游实验没有动作条件,跨游戏的 inverse dynamics 也还没有,洗净的视频暂时只能当观测,不能当观测-动作轨迹。GameCleaner 仍走完整生成轨迹,没做 few-step 蒸馏。作者在把数据往 100 万对扩。
引言里合成集「平均分 0.5697、比 LoomVideo 高 40.3%」和主表对不上,主表 LoomVideo 的 Overall 只有 42.82,数字应以 Table 3 为准。Pilot 用的是 T2V 不是带动作条件的世界模型,6.83% 只说明去 HUD 改善了视频生成监督,不能直接说互动世界模型变强。评测分辨率从 448p 扫到 1080p 会改分数,跨论文对比必须锁同一分辨率。合成叠上去的 HUD 再让模型撕掉,和真实半透明、运动模糊、压缩伪影不是一回事;无参考时野外 AAR 从 95 掉到 48,泛化仍是主瓶颈。