WorldMind: Decoupled Game World Model for State-Aware NPC Behavior
Zhiyang Deng, Boran Zhang, Danze Chen, Yeying Jin
cs.CV
2026-08-18
腾讯NUS把游戏世界模型拆成四层闭环,NPC按距离与冷却自己出招;Game A上一分钟对局中,约70%两两对比优于隐式或外部指定行为的基线。
现有游戏世界模型已经能按玩家操作生成下一帧,Oasis、Genie、Matrix-Game 走的都是「输入动作、输出画面」这条路。NPC 的行为却一直没被单独拿出来:多数系统里 Boss 只是视频先验里的运动模式,跟着画面一起被生成;另一路把 NPC 动作做成外部控制通道,世界模型自己并不决定下一招打什么。
两种做法都没有给 NPC 一个读当前局势再决策的接口。Boss 战特别吃这个。该不该冲、该不该放技能,取决于距离、朝向、上一招是什么、冷却好了没有。理解、规划和渲染捆在一次扩散过程里,NPC 很难跟上快速变化的状态。
WorldMind 把交互式世界建模拆成四层,再在闭环里接回去,自称是第一套把状态感知 NPC 行为从画面生成里解耦的游戏世界模型。机构是腾讯与新加坡国立大学,实习项目。
配套数据叫 BOSS-140K,全称 Boss-fight Observations with States and Skills:144,631 条片段、超过 200 小时,14 个 Boss,来自匿名的 Game A、《Hollow Knight》和《The Binding of Isaac》,覆盖 2.5D 与 2D。Game A 整段打码。采集靠一个吃引擎状态的自动对打 agent;引擎状态只用于收数据,推理不可见。
L1 在三款游戏上都能重建几何。相对中位交战距离的误差 Game A 2.9%、Hollow Knight 6.7%、Isaac 8.4%;距离分箱准确率分别是 0.807、0.772、0.904。Isaac 的角度 MAE 到了 29.38°,比另外两款粗一截。任务训练过的编码器在所有几何指标上优于冻结的 DINOv2-S 和 VideoMAE-B。
L2 换掉技能说明就会改招。技能名被换成中性编号,只留机制文本。去掉描述后,第一招变化率在 Game A / Hollow Knight / Isaac 上分别是 52.0%、90.0%、55.4%(样本 200 / 200 / 121);对调描述后变化率 83.5%、87.0%、80.2%,跟着被换过去的机制走的比例是 69.0 / 73.5 / 79.3,死守原编号的只有 16.5 / 13.0 / 19.8。给 LLM 再贴一帧画面没有稳定增益,后两款的机制跟随率还掉了 6.5 和 8.2 个百分点。紧凑状态这张小卡片对决策够用,像素是多余的。
闭环只在 Game A 上评,一分钟 rollout、12 个决策点,GPT-5.5 和 Gemini-3.1-pro 当评委,各打三遍取均值。三条系统共用 Wan 2.2 骨干和同一份训练语料,差在 NPC 行为怎么来。
| 方法 | NPC 行为 | GPT 偏好 / 合法率 / 序列契合 | Gemini 偏好 / 合法率 / 序列契合 |
| Wan 无 NPC 控制 | 隐式生成 | 71.5% / 63.6% / 3.28 | 69.8% / 70.6% / 3.20 |
| Wan 有 NPC 控制 | 外部指定 | 70.9% / 63.6% / 3.22 | 70.3% / 70.9% / 3.17 |
| WorldMind | 状态感知 | 不适用 / 74.0% / 3.85 | 不适用 / 77.6% / 4.00 |
表里的偏好是 WorldMind 对基线的两两胜率,大约 70%。WorldMind 自己的逐步合法率 74.0% 和 77.6%,整段序列契合 3.85 和 4.00(0–5 分)。两条基线的合法率卡在 63.6% 或约 71%,序列契合停在 3.2 附近。
在公开的 WildWorld 上,决策层有部分跨游戏迁移且仍对状态敏感,几何重建需要目标域适配。
游戏世界模型这波里,玩家控制已经是标配,NPC 还停在「看起来会动」。WorldMind 把 NPC 行动做成显式决策,输入不是像素,是一张很小的状态卡。做可玩世界模型的人可以直接套这套分层:视觉生成继续用扩散,决策交给不微调的小 LLM,中间用文本动作接口对齐时间。
它还做不到替换行为树。一分钟、LLM 评委、单一 2.5D 游戏上的约 70% 偏好,说明的是「显式状态决策比埋进视频更像样」,距离能上线当关底还早。
论文没有单独的 Limitations 节,能看到的缺口不少。
闭环评测只做了 Game A,Hollow Knight 和 Isaac 停在层内指标。评委是两个 LLM,没有人类对打、也没有人类打分。几何分支 seed 固定为 0,没有方差。Isaac 角度误差接近 30°,紧凑状态在 2D 弹幕视角上更糊。换新游戏时决策能部分迁移,重建不行,几何还得重新标。
L2 强调按机制推理、不微调,但技能菜单、Boss 身份、机制文本都是人写的。说明写得差 Follow 率会不会掉,没有测。战术质量只写「比随机合法招更合适」,没给数字。一分钟 12 步覆盖不了完整 Boss 战的阶段转换。Game A 整段打码,外部无法复核那部分数据。蒸馏到 20 FPS 的是生成层,决策还要跑一遍 Gemma,端到端延迟论文没拆开报。