8000条游戏样本、0.199%参数,把33B视频模型变成可交互世界

H3-World: Turning Language Understanding into World Control

Danze Chen, Zeqing Wang, Ziyue Lin, Xingyi Yang, Yeying Jin

cs.CV, cs.AI

2026-09-02

H3-World把角色和相机指令写成文本、按潜变量对齐时间,仅用约8000条游戏样本、一万步LoRA和0.199%可训练参数,就把33B的MiniMax-H3变成可交互世界模型。

这篇在解决什么

视频生成模型越来越强,语言已经能粗控角色和镜头,MiniMax-H3 零样本就会对「往左走、镜头右摇」给出大致对的运动。可交互世界模型要的不是大致对,是这一段 latent 执行这一条指令、下一段换指令时不串台。

现有做法通常另学动作嵌入、FiLM 或相机几何模块,等于在预训练模型上面再铺一条控制通路,贵,还可能把生成质量打坏。腾讯、新加坡国立和港理工的这篇,选择不另开动作模块,把控制留在模型已经听得懂的文本通道里。

方法

每个视频潜变量对应一小段 RGB。这段里的键盘状态聚成一个潜变量级动作,再拆成角色子句和相机子句,拼成一句短指令,例如「the man walks backward and strafes left, camera pans right slowly」。角色 9 种、相机 16 种,笛卡尔积 144,结构上有效 135 种。训练数据只覆盖 83 种,52 种没见过;最频的 20 种占 71.4%,40 种占 95.4%。这是一个天然的组合泛化测试床。

每条指令独立编码,再和静态语义、首帧条件、视频潜变量打进 H3 的单流自注意力。位置编码让第 k 条指令和第 k 段视频潜变量对齐。单出口路由规定:一条指令作为 key 时,只有自己和对应的那一段视频能读它;视频段之间仍保持 H3 原有的双向注意,动作效果从入口渗进整段运动。LoRA 只改注意力 QKV、输出投影和两层 token refiner,秩 32,骨干冻结。训练用 ABot-World-Explorer-500h 里 7872 条 124 帧片段,1 万步,学习率 1e-4。

结果

定量诊断主要靠 Farneback 光流的累计水平分量。固定初帧和种子、镜头先猛左后猛右时:全局一句提示在切换前是 0.0、切换后 -17.3,左向几乎没跟上;零 LoRA 的逐段接口几乎静止;H3-World 是 +52.7 再 -106.0,两个方向都跟。指令顺序反过来,H3-World 是 -58.7 再 +121.0。恒定单向时,全局提示和 H3-World 的方向分离几乎一样(301.8 对 300.5),说明预训练已经会粗控,缺的是时间绑定。

把键盘状态做成向量再加到视频特征上,或做 FiLM,在留出片段上对记录动作的响应弱且不稳,文本接口更跟手。固定初帧只改指令时,左右平移和快慢摇镜会走出可区分的轨迹。没见过的「前进+摇镜俯仰」组合,在留出游戏画面和分布外初帧上都能同时执行两个子句。

为什么重要

大视频模型里,控制接口可能已经藏在语言通路里,缺的是时间对齐,不是再学一套动作空间。对想做交互世界模型的人,这意味着不必从零训条件模块:几千条对齐轨迹加千分之二的 LoRA,就能把粗控收成可调度的角色和相机。组合泛化也说明,把动作拆成可复用子句,比把整段键位编码成一个向量更划算。

局限与存疑

生成仍是固定 124 帧、50 步去噪,没有持久世界状态,也没有实时交互、规划或策略学习。组合泛化和视觉迁移主要靠代表性例子和光流诊断,没有在 52 个未见组合、多种场景和多种随机种子上给出成功率。训练分布严重偏斜,高频 40 种组合占了 95.4%,低频动作的可靠性不清楚。单出口路由是硬编码掩码,不是学出来的,换到别的视频骨干上要重做。评测绑定在 ABot 游戏数据上,真实世界视频会不会同样听话,这篇没有测。

术语

原文与代码

社区讨论

相关论文

全部论文解读