GameWAM在MCU Mini达50.7%成功率,成功回合原生操作仅138步

GameWAM: A World Action Model for Video Games

Yuncheng Guo, Zhanqiu Zhang, Yiwen Guo, Weijia Li

cs.AI, cs.CV, cs.LG

2026-08-26

复旦与LIGHTSPEED提出GameWAM,并行Video与Action DiT同时生成未来画面和可执行键鼠轨迹。MCU Mini成功率50.7%,对标OpenHA的36.8%;成功回合平均只需138步原生操作。

这篇在解决什么

游戏智能体把画面和任务直接映射成键鼠动作,并不显式预测世界会怎么变。交互式游戏世界模型反过来:给了动作才能滚出下一帧,自己不当策略。World-Action Model 把未来观察和可执行动作一起生成,但现有工作多在桌面机械臂或有界室内操作,没人在第一人称、状态持久、键鼠混用的电子游戏里闭环跑过。

Minecraft 和 ViZDoom 把这个问题放大。同一套物理键鼠,在玩法里是相机偏航,在 GUI 里是光标位移,条件分布完全不同。视觉还得相对原生动作降采样:看太密,固定 token 预算就看不远;看太疏,瞬态交互又会被漏掉。

方法

GameWAM 用两条并行的 Diffusion Transformer。Video-DiT 从 Wan2.2-TI2V-5B 初始化;Action-DiT 同为 30 层 24 头,隐层从 3072 收到 1024,权重从视频骨干适配过来。两边用 flow matching 联合训练。注意力是块因果的:当前块的画面和动作都能看见已经发生的干净前缀,但噪声状态互不交叉。上线时可以只出动作,不必把未来视频也 denoise 一遍。

异构控制靠逐步路由。每个动作时刻预测当前是玩法还是 GUI,再选对应的预测头和连续动作归一化;离散按键共用一套。不可用通道用有效性掩码挡住。

长程靠 block-cycle:一次预测 P=16 步原生动作,只执行前 E=8 步,拿新观察再规划。三个执行块合成一个 24 步 cycle。cycle 内 KV 缓存用完即丢;跨 cycle 保留最近两段压缩观察,更早的内容进注意力池化的长期槽位,最多 40 个 token。训练时在同一条轨迹上按 E 步锚定、对重叠的 P 步计划做 teacher forcing。

训练数据三条流对齐到同一时间轴:事件锚定的 VPT 占 80%,常规 VPT 5%,脚本 GUI 15%。事件附近 stride 2,远处 stride 16。8 张 H200、两轮大约 22 小时,按采样日程消耗 2.79B token。推理用 10 步一阶积分。

结果

MCU 超过 800 个任务。Mini 平均成功率 50.7%,OpenHA 是 36.8%。全量平均 46.6%,带多游戏预训练的 Game-TARS 是 42.5%。成功回合的原生步数全面更少:

类别GameWAM 步数OpenHAGame-TARSGameWAM 全量 ASRGame-TARS 全量 ASR
具身13828737347.5%50.4%
GUI15531440660.0%39.1%
战斗20331637232.2%38.1%

拉开总分的是 GUI。具身和战斗的全量成功率仍低于 Game-TARS。方差很大:Mini 具身是 70.0±32.2。

ViZDoom 四张图、每图 50 局,用平均回报作图。GameWAM 相对 Game-TARS 全面更高,和 o4-mini、GPT-5、Gemini-2.5-Pro、Claude-4-Sonnet 比是领先或持平。正文没有可抄的精确分数。

MCU Mini 消融:去掉未来视频监督,平均从 50.7 掉到 35.7;更粗时间采样 36.7;不做事件锚定采样 38.0;玩法/GUI 合成一套分布 38.3;令 P=E 则 41.3;去掉跨 cycle 历史 46.7,具身点估计反而升到 75.0,GUI 掉到 31.0。

更关键的发现叫 LASI。闭环时如果复用同一次采样的动作源,有的实现会把相机往一个方向拧,原地转圈,任务几乎完不成。固定条件下,偏航的 DCT 0 阶与源低频相关系数 r=0.890;只替换源的 0–2 阶,输出偏航 DCT0 在 94.8% 的试验里跟着供体走;把这一频段置零,相关输出方差掉 99.25%。评测时每步重采样源,能挡住累积,去不掉根上的源敏感。训练期想拆掉耦合,压太狠会伤动作学习。

为什么重要

键鼠游戏智能体如果只学行为克隆,成功了也不知道画面该怎么变。GameWAM 说明联合世界-动作生成能在 Minecraft 里用更少操作打到可比成功率,尤其 GUI。对做生成式策略的人,LASI 比排行榜更值得记:flow 策略的噪声源可以变成低频控制偏置,闭环复用会放大。

它仍是低层控制器,不维护配方图或库存计划。和 OpenHA、Game-TARS 这类分层或大规模预训练智能体不是同一层接口。

局限与存疑

作者自己划了边界:不维护符号任务图;持久历史几乎只是视觉,辅助损失只预测当前干净视觉特征,不监督该取哪段历史。评测停在数字游戏,没有真机迁移。MCU 偏原子任务,缺意图连贯的长交互链。LASI 目前没有不伤性能的机制解。

Game-TARS 有多游戏预训练标记,GameWAM 没有,全量平均超过它主要靠 GUI;具身和战斗全量仍落后。Mini 方差极大,点估计别读成稳定领先。ViZDoom 只有图、没有表。

术语

原文与代码

相关论文

全部论文解读