Marionette: Predicting World States, Rendering Geometry, Painting Appearance
Zian Meng, Zhen Li, Chuanhao Li, Qiang Li, Kaipeng Zhang
cs.CV, cs.AI
2026-08-15
把交互式游戏世界模型拆成「小模型预测 276 维显式状态 + 零参数渲染器算几何 + 视频扩散只管外观」,画面质量不掉(FVD 831 对录制姿态的 799),长时程穿地帧占比砍 66%。
交互式游戏世界模型的通病:在像素或 latent 空间里自回归地生成画面,姿态、几何、遮挡这些结构化属性只能被隐式地维持在同一个生成序列里。滚得久了误差累积,一致性与可控性一起碎掉:角色穿进地里、两个角色越漂越远,而且没处修,因为「世界长什么样」没有显式的表示可以下手。
Marionette 的思路是把「预测什么」和「精确计算什么」切开:神经网络只负责它擅长的(动态与外观),一切要求精确的量(度量几何、根轨迹积分、关节运动学、相机投影)交给一个零参数的确定性渲染算子。三段流水线:
控制因此变得干净:想让角色做什么,直接覆写那一帧的动作 token,不用重训、不用额外条件网络。修长时程漂移也一样:在显式状态上加两条规则(地形碰撞体、分离上限),观测模型一个参数不动。
数据来自商业动作游戏《怪物猎人:荒野》的引擎级录制(WildWorld 语料),同一份素材带同步的两个视图:RGB 视频流与逐帧 276 维状态。动力学训 1395 段、20fps、约 227.6 小时;观测模型训 4008 段、704×1280、约 673.8 小时。
| 度量 | Marionette | 对照 |
| FVD16(16 帧片段) | 831 | 像素自回归基线 975;录制姿态 799 |
| 长滚动末块 FVD | 1013 | 基线 1198 |
| 换掉动作流后关节误差(RA-MPJPE) | 0.357 m | 正确动作 0.272 m,退化 31% |
| 两角色分离距离 | 规则后 5.1 m | 无规则 21.2 m;录制 4.8 m |
| 穿地帧占比 | 加碰撞体后 0.114 | 无规则 0.337,降 66% |
两件事被分开验证了。状态层:48 个保留段上,把动作流换成打乱的,关节误差从 0.272 m 涨到 0.357 m,33/48 段变差,说明预测的状态真的吃动作输入,不是自说自话。观测层:把外观绕道预测状态再渲染,FVD 831 对直接用录制姿态的 799,置信区间重叠,论文判定检测不到保真损失。
这是世界模型架构路线的一次清晰示范:不把所有结构塞进 latent 里赌神经网络自己学会守恒,而是显式建模状态、把精确计算外包给传统图形学,神经网络退回去只做它擅长的事。对做交互内容生成的人,收益有三重:可控性(覆写 token 即控制)、可修性(在状态上加规则即可修,不用动生成模型)、可解释(276 维每一维都有物理含义)。对更广的具身智能与仿真方向,「用可微或确定性渲染器约束生成」这个分工原则比本篇的具体数字更值得带走。
作者列了三条:长时程外观会漂,几何精确但外观只靠分块接力种子维持;画面里有些实体(AI 随从、小怪)没有录制骨架数据,成了观测模型「解释不了」的内容;观测模型在录制姿态上训练、推理时吃生成姿态,存在分布偏移。
读下来还有几点要留意。规模上这只是单怪物类型、双角色的实例化,动力学词表 173+689 个动作,离「通用游戏世界模型」很远;FVD 是分布度量,与基线的置信区间重叠,「不掉保真」的结论是「检测不到损失」,不是「证明无损」;穿地修复靠手写规则,规则本身(地形碰撞体、分离上限)是知道失效模式后才加的,通用性未验证。零参数渲染器要求场景有可提取的骨架与地形表示,这对大多数真实视频数据并不成立,方法的前提条件本身就是门槛。