语言当动作接口:Qwen 具身世界模型四项物理指标满分

Qwen-RobotWorld Technical Report: Unifying Embodied World Modeling through Language-Conditioned Video Generation

Jie Zhang, Xiaoyue Chen, Anzhe Chen, Dayiheng Liu, Deqing Li, Gengze Zhou, Hale Yin, Haoqi Yuan, Haoyang Li, Jiahao Li, Jiazhao Zhang, Jingren Zhou, Kaiyuan Gao, Kun Yan, Lihan Jiang, Ningyuan Tang, Pei Lin, Qihang Peng, Shengming Yin, Tianhe Wu, Tianyi Yan, Xiao Xu, Yan Shu, Yanran Zhang, Ye Wang, Yi Wang, Yilei Chen, Yixian Xu, Yiyang Huang, Yuxiang Chen, Zekai Zhang, Zhendong Wang, Zixing Lei, Zhixuan Liang, Zihao Liu, Zikai Zhou, Chenxu Lv, Xiong-Hui Chen, Chenfei Wu

cs.CV

2026-06-16

以自然语言为统一动作接口的具身世界模型:输入当前画面和一句动作,预测物理合理的未来视频,EWMBench/DreamGen 双榜第一,WorldModelBench 物理对齐四项满分。

这篇在解决什么

具身智能缺一个像样的世界模型(world model)。这里取严格含义:给它当前的一帧画面和一个动作,它能预测下一个时刻世界会变成什么样。自动驾驶要预判车流、机械臂要预判抓取后物体怎么动、导航要预判拐弯后看到什么,归根结底是同一个问题。

之前的视频生成模型分两派。通用视频模型(Veo、Wan 这类)画面漂亮,但不吃动作输入,也不知道牛顿定律,生成的视频物理上经常穿帮。机器人专用的世界模型又太窄,只认一种机器人、一种动作格式,没法跨本体泛化。Qwen-RobotWorld 想用一条路打通:把自然语言当成统一的动作接口,一个模型预测跨操作、驾驶、导航、人机迁移的物理未来。

方法

核心是一个 60 层的双流扩散 transformer(Double-Stream MMDiT)。两条流:一条是冻结的 Qwen2.5-VL(7B),负责把语言和语义压成 token;另一条是 Wan-VAE(127M)编码的视频潜变量。层与层之间做联合注意力,让语义流去条件化视频流。关键在于,这里的语言不只是字幕,而是「动作」——MLLM 把一句动作描述编码成 token,这些 token 直接驱动视频生成。

数据上,他们造了 Embodied World Knowledge(EWK):860 万视频-文本对、2 亿+帧,覆盖 20+ 种本体、500+ 种动作,70% 是具身数据、30% 是通用数据。核心构造是「动作-语言映射」,把一句话的动作描述和它造成的视觉变化配对。

训练分两阶段(General+Expert 渐进课程):先学通用视觉先验,即世界长什么样、物体怎么动;再注入具身特化,即动作条件下的物理动态。两阶段共用同一个语言接口。

结果

必须看具体数字,「效果好」三个字是废话。

榜单结果对照
EWMBench 总分4.60,第一LVP 4.05
EWMBench 运动保真(HSD)0.566LVP 0.425,高 33%
DreamGen Bench4.952,第一
WorldModelBench 总分8.99,开源第一、总第三Wan2.6 9.27、Veo3 9.25
WorldModelBench 物理(牛顿/质量/流体/重力)四项 1.00 满分穿透率 0.94
PBench0.804,开源第一领域理解 0.857

WorldModelBench 上,闭源的 Wan2.6 和 Veo3 仍在前面,但 Qwen-RobotWorld 是开源里第一个够得着的,而且物理对齐四项拿了满分。一个不太好看的维度是指令遵循,只有 2.33/3.0,低于 Veo3 的 2.52。

为什么重要

一个把自然语言当动作的世界模型,是三件事的地基:给策略训练生成合成数据、当虚拟环境评测策略、给下游机器人提供语言引导的规划信号。物理对齐拿满分这点尤其关键,它说明模型内化了物理规则,不只是学会了生成「看起来像」的视频。对做具身数据增强和仿真评测的人,这是目前开源里最值得拿来跑的。

诚实地讲,这仍是技术报告。闭源的 Veo3、Wan2.6 总分更高,真正决定这套东西有没有用的闭环(拿预测的未来去训练或改进控制策略)论文里只给了定性展示。

局限与存疑

术语

原文与代码

社区讨论

相关论文

全部论文解读