From Pixels to States: Rethinking Interactive World Models as Game Engines
Zhen Li, Zian Meng, Shuwei Shi, Mingliang Zhai, Jiaming Tan, Chuanhao Li, Kaipeng Zhang
cs.CV
2026-07-16
分析论文:用游戏引擎的「动作-状态-观察」循环盘点现有可交互世界模型,四个维度拆解短板,并放出《黑神话:悟空》90 小时帧对齐的动作加状态数据集。
最近一批视频生成模型给了「可交互世界」一条数据驱动的路:根据玩家动作预测下一帧,被当成下一代游戏引擎的候选。但真正可交互的游戏世界要求三件事同时成立:交互结果要遵循随游戏状态演化的规则、后果要在长程里持久、生成还得实时。传统游戏引擎靠一个「动作-状态-观察」的循环实现这些,玩家动作按预定义规则更新显式游戏状态,观察再从状态渲染出来。这篇就拿这个循环当镜子,盘点现有方法到底卡在哪。
没有新模型。作者沿四个维度,把现有做法归成几个代表家族,讲各自取舍:
配套一个可扩展的数据引擎,采集《黑神话:悟空》90 小时实机,1280×720、30 FPS,主要是高频交互的 boss 战长 rollout。每帧帧对齐地存:原始鼠标键盘输入、游戏状态(位姿、动画、技能、属性)、RGB 加深度图,外加结构化 slot caption 和用 Qwen3-VL-235B 生成的语义 caption。
这篇没有跑模型对比的 benchmark 表。它的「结果」是一张领域地图加一套数据:四个维度下每类方法的强弱被讲清楚,数据集填补了「状态感知的世界模型建模」缺数据这个具体空白。作者的核心判断是,现有方法在自然输入控制和接近实时的生成上已经做得不错,但真正难的能力都「围着游戏状态打转」,而大多数模型把状态藏起来、没有显式表示。
对做世界模型和游戏 AI 的人,这篇的价值是省时间:不用自己从头摸清这个子领域的家族谱系和各自短板,四个维度的框架可以直接拿去对位自己的工作。90 小时帧对齐状态的数据集是更实在的贡献,现在拿得到带真实游戏状态标注的交互数据很少,这给「把显式状态接进生成循环」这类方向提供了原料。它是立场文件加数据,不是刷点论文,期待要放对地方。
这是分析加立场论文,不是实证研究:没有模型、没有可复现的实验、所有「谁强谁弱」都是定性梳理,作者自己对各家族的归类带主观判断。数据集只覆盖一款游戏(《黑神话:悟空》),且聚焦 boss 战这一种高交互场景,能不能代表开放世界探索、多种玩法存疑;90 小时相对真实游戏的多样性也偏窄。框架本身(四维度)是作者的组织视角,并非公认分类法。作者期望它「推动领域前进」,但立场论文的影响力最终取决于社区是否买账这套分类和数据是否被用起来,这两点现在都还看不到。