撕掉画面上的游戏HUD再训Wan,同一批5442条录像VideoReward涨6.83%

Game2World Engine: Unlocking In-the-Wild Gameplay Videos for World Model Training

Wenxuan Shen, Dongna Jin, Dongping Chen

cs.CV

2026-08-25

网上的游戏录像混着血条、小地图和主播水印,不能直接当世界模型数据。G2WEngine抽出5132个HUD资产合成9.6万对;GameCleaner无mask去界面,合成集AAR 95.36,洗净后微调Wan,VideoReward涨6.83%。

这篇在解决什么

网上的游戏录像看起来像现成的世界模型数据:场景多、交互乱、轨迹也长。下载下来的却是一张合成画面。血条、小地图、任务提示、击杀播报、主播摄像头和水印全叠在屏幕空间里,不属于游戏世界,却会进训练信号。

同一批 5442 条干净片段,一份保持原样,一份用引擎叠上合成 HUD,再分别微调 Wan-2.1-T2V-1.3B。干净数据把生成视频的 VideoReward 整体分抬了 6.83%,运动质量一项高 18.8%。清晰度反而掉 1.43%,因为 HUD 上的锐利文字会被清晰度指标加分。

问题不是游戏视频太少,是界面和世界缠在一起。这篇把拆开做成一条可扩展的数据工序。

方法

整条链路叫 G2WEngine,四步走完。

合成集 Game2World-S 有 9.6 万对。野外集 Game2World-W 是 1079 条真实 5 秒片段,来自同样 303 款游戏,没有干净底片;第一帧用 GPT-5.6 Sol 标,动态元件再逐帧人工改。

去界面模型叫 GameCleaner,推理时不吃 mask。骨干跟 Kiwi-Edit 一样:多模态大模型编码源视频和「去掉 HUD」指令,可学习 query 抽出语义条件灌进视频 DiT;源视频的 VAE latent 以随时间步变化的残差接回,免得把场景改丢。MLLM 和连接器冻结,只对 DiT 打 rank-64 的 LoRA,flow matching 训 3000 步,8 张 H100,全局 batch 32,学习率 1e-4,分辨率 720p。带参考图的变体训练时随机丢掉 20% 干净参考,测试时可以给一张干净帧,也可以不给。

结果

Pilot 里干净数据微调后的 VideoReward:视频质量 -0.643、运动质量 -0.298、时间对齐 1.008、总分 0.068;叠界面对照是 -0.661、-0.367、1.018、-0.009。美学分 6.109 对 5.626,运动一致性 16.392 对 15.706。

去 HUD 评测用 MLLM 当裁判,抽 2 FPS 关键帧。人工对齐在 200 条视频、6150 个元件标签上,removed F1 87.78%,Cohen's κ 0.820。核心指标 AAR 按伪影打折:清干净且无伪影记 1.0,有轻微伪影 0.5,没去掉或不确定记 0。BG 看框外场景有没有被改。

方法合成 AAR / BG野外 AAR / BGOverall
VACE-1.3B(有 mask)59.11 / 96.5030.40 / 91.4569.37
EffectErase(有 mask)56.17 / 84.4523.55 / 74.5559.68
Aurora(无 mask)60.62 / 24.4551.19 / 14.0037.57
Kiwi-Edit(无 mask)34.68 / 97.3013.54 / 96.8060.58
GameCleaner95.36 / 99.0048.56 / 99.6085.63
GameCleaner(带参考)94.64 / 98.8580.05 / 99.8093.34

合成集上,相对最强无 mask 基线 Aurora 的 60.62 AAR,GameCleaner 高出 57.3%。EffectErase 的原始「去掉了」分数很高(合成 94.56、野外 92.00),AAR 和 BG 却掉下去,旁边的场景经常被一起改掉。带参考的 GameCleaner 野外 Track-Clean 68.12,EffectErase 只有 16.12。

参考图 20% dropout 最合适:野外 AAR 从 0% 时的 70.64 升到 80.05,50% 和 80% 掉到 56.23 和 54.64。训练数据从 60% 加到 100%,合成 AAR 只多 2.06,野外 AAR 多 25.09。合成已经接近饱和,野外还在吃多样性。

为什么重要

Genie、GameGen-X、MineWorld 这类系统,训练时基本把渲染帧当成世界观测。网上的实况录像量级远大于能插桩的模拟器,这条路一直被 HUD 卡住。这篇把洗界面做成可并行的片段级工序,不再给每款游戏单独写一份编辑脚本。

对要拿游戏视频训世界模型的人,结论很具体:先把界面拿掉,运动质量和美学分才会朝对的方向动;只看「UI 还在不在」会高估那些乱改背景的编辑模型。GameCleaner 不需要画 mask,跨 303 款未见布局也能跑。代码、数据和模型声称会放到 GitHub。

这是数据工程上的一步,不是新的世界模型结构。下游验证还停在文本条件的视频生成代理上。

局限与存疑

作者自己写了几条硬的。Game2World 还没覆盖游戏、界面和录制条件的完整分布;大块不透明面板、快速闪动的叠加层、和场景纹理缠在一起的元件,重建会糊。下游实验没有动作条件,跨游戏的 inverse dynamics 也还没有,洗净的视频暂时只能当观测,不能当观测-动作轨迹。GameCleaner 仍走完整生成轨迹,没做 few-step 蒸馏。作者在把数据往 100 万对扩。

引言里合成集「平均分 0.5697、比 LoomVideo 高 40.3%」和主表对不上,主表 LoomVideo 的 Overall 只有 42.82,数字应以 Table 3 为准。Pilot 用的是 T2V 不是带动作条件的世界模型,6.83% 只说明去 HUD 改善了视频生成监督,不能直接说互动世界模型变强。评测分辨率从 448p 扫到 1080p 会改分数,跨论文对比必须锁同一分辨率。合成叠上去的 HUD 再让模型撕掉,和真实半透明、运动模糊、压缩伪影不是一回事;无参考时野外 AAR 从 95 掉到 48,泛化仍是主瓶颈。

术语

原文与代码

相关论文

全部论文解读