WorldExam: Benchmarking World Models from Apparent Appearance to Inherent Reactivity
Yuxue Yang, Shuyao Shang, Jiahe Wang, Zitong Zhou, Liang Tan, Junhan Zeng, Ruizhi Li, Junyan Li, Yu Liu, Xiao Yang, Yong Li, Jun Zhu, Hongsheng Li, Tieniu Tan, Lue Fan, Zhaoxiang Zhang
cs.CV
2026-08-04
WorldExam 提出「世界反应性」维度,用 1,474 个用例评测 20 个视频世界模型,发现画质与显式指令完成都不保证世界会正确反应。
可控视频生成模型正被当成「世界模型」来卖,给一张初始图加一段相机、动作或语言指令,就该预测出合理的未来画面。可市面上的评测还停在两个层面:画面漂不漂亮,以及模型有没有照着显式指令把要求的动作或交互结果演出来。真正区分「世界模型」和「视频生成器」的,是那种指令里没写、但场景暗含的反应:主体上楼梯时身高该随地形起伏,靠近障碍物时该出现接触、绕行或被挡,闯入别人的社交距离时该有人让路。这些是场景状态的隐含后果,不是输入的直接描摹。WorldExam(CASIA 牵头,联合港中文、清华等)要补的就是这道缺了许久的考核。
核心是一条由浅入深的四级诊断阶梯:Visual Quality(视觉质量)、Control Adherence(控制服从度)、Spatial Consistency(空间一致性)、World Reactivity(世界反应性)。前三层都在「显式」范畴内,画面质量、相机和主体是否听话、回到旧视角时世界能不能拼回去;第四层才进入隐式反应。
跨范式比较靠两步:先把每种可控行为拆成原子控制单元(W/S/A/D 等离散动作或相机基元),再做接口适配,把同一组控制意图翻译成相机驱动模型吃的 SE(3) 轨迹、动作驱动模型吃的键盘式离散动作、语言驱动模型吃的自然语言。关键设计在 World Reactivity 这一层:模型面对的输入只写显式控制或高层目标,场景会怎样反应全部留白,逼模型自己从场景推断后果。这一层分五个任务,分别是 Terrain Interaction(地形适应)、Object Interaction(物体接触)、Social Interaction(社交避让)、Physical Reaction(重力/碰撞/摩擦/流体等物理过程)、Goal Completion(语言独占,给目标不给步骤)。
全基准共 1,474 个用例、八个任务,分两条赛道:静态场景赛道(相机控制 + 场景重访,三类范式都能跑)和动态交互赛道(主体控制 + 五个反应任务,仅限能稳定控制第三人称主体的动作和语言模型;Goal Completion 仅语言)。评测手段分两套:相机、主体、地形、重访这类有几何答案的,用 VGGT-Ω 把生成视频提升到 3D,在重建空间里算轨迹和高度误差;剩下四个语义任务交给 GPT-5.5 当 VLM 裁判,按预设清单逐条判定。相机驱动模型还多了生成前的图像位移对齐校准,免得它们因为「位移幅度」被冤枉。
20 个模型(6 相机、7 动作、7 语言)测下来,一句话:画质好不等于会反应。
静态赛道相机控制分数分化极大。重建 3D 先验再投影的 NeoVerse 拿 97.33、InSpatio-World 85.94;而把相机姿态编码成 token 的 ReCamMaster 只有 38.64、FantasyWorld 18.46,可两者的 General 视觉分都在 80 以上。动作驱动 WorldPlay 92.74;语言驱动最高 Hailuo 2.3 仅 63.29。场景重访 NeoVerse 89.25、InSpatio-World 85.90。语言驱动一组的 General 均分挤在 79.64–81.04 的窄带里,Task 均分却从 39.85 拉到 65.02,视觉指标根本分不开它们。
| 任务 | 语言驱动最高 | 动作驱动最高 |
| Subject Control | Veo 3.1 37.28 | LingBot-World 55.47 |
| Terrain Interaction | Vidu Q3 64.39 | WorldPlay 27.49 |
| Object Interaction | Veo 3.1 75.96 | WorldPlay 33.75 |
| Social Interaction | Veo 3.1 85.10 | LingBot-World 60.37 |
| Physical Reaction | Hailuo 2.3 63.84 | LingBot-World 33.43 |
| Goal Completion | HappyHorse 1.0 85.33 | 不支持 |
动态赛道的反应性才是分水岭。动作驱动模型主体控制更准(LingBot-World 55.47、WorldPlay 49.75,高于语言组最高的 Veo 3.1 37.28),到了反应任务却全线塌,Physical Reaction 最好分只有 33.43。最讽刺的是 Kling 2.5:语言组 General 均分最高,Goal Completion 却只有 48.25。
辅助验证也站得住:对 NeoVerse 把输入平移倍率从 0.10× 调到 2.00×,Camera Control 从 98.25 跌到 95.32,Photometric Consistency 从 80.17 跌到 62.45;VLM 裁判在 800 个实例、5,793 个清单项上与人评 Spearman ρ=0.8614、PLCC=0.8583(Social Interaction 最弱,ρ=0.7019);换 DA3 重建后端,静态 Overall 均绝对相对变化 3.09%、动态 0.57%,排名稳定。
对从业者有三层信号。第一,挑视频世界模型不能再只看 VBench 那类视觉分,语言驱动一组的 General 分几乎贴在一起,真正拉开差距的是反应性任务。第二,三种范式各有所短:相机驱动拿不下交互,动作驱动控制准但世界是「死」的,语言驱动会演交互但跟不上复合控制,今天没有任何一个模型能通吃。第三,把视频生成模型当世界模型去部署(游戏、机器人、具身 AI)的团队要清醒:遇到地形、物体接触、社交冲突、物理过程,这些模型常常原地不动或直接穿模。
作者自己承认几条:动态交互赛道要求稳定的第三人称主体控制,把多数动作驱动和所有相机驱动模型挡在外;Goal Completion 只能在语言模型上跑;指标只看端到端可观测行为,没法证明模型内部真学到了因果表示,闭源系统的私有 prompt 增强也可能混入场景理解。再补几层怀疑:VLM 裁判本身带偏差,Social Interaction 的人评对齐 ρ 只有 0.70,语义任务的绝对分数未必稳;反应性判定的视野只有 100–200 帧,长程物理一致性没被压测;接口适配对动作驱动模型未必公平,离散动作到 SE(3) 的映射可能系统性低估了它们的反应能力。