PhiZero:让世界模型先学会一种「物理语言」再预测未来

PhiZero: A World Model Built Around Physical Language

Shuyao Shang, Yuqi Wang, Ruopeng Gao, Xu Chen, Tieniu Tan, Lue Fan, Zhaoxiang Zhang

cs.CV

2026-07-31

PhiZero 从野外视频自监督学出一种离散「物理语言」刻画状态转移,先推理出物理语言序列再渲染成视频。Physics-IQ Verified 拿到 41.2 分,超过 Sora 2、Cosmos3-Super 等。

这篇在解决什么

视频世界模型能生成高保真画面,被当成物理世界的模拟器来用。但主流做法是直接在像素空间预测未来,世界的物理动态被隐含在高维视觉预测器里,经常生成物理上不自洽的结果:球撞了鸭子鸭子不动,碰撞没有后果。

人类从视觉经验里抽象出「世界怎么演化」的规律,再用语言组织、显式推理,并不逐帧死记画面。自然语言在数字世界很好用,但用来描述物理世界的状态转移太粗。PhiZero 的问题是:能不能学一种比自然语言更细粒度的「物理语言」,用来显式推理世界演化?

方法

PhiZero 用「先推理再渲染」(reason-then-render)的范式,核心是自监督学出一种离散的物理语言,刻画视频里的状态转移。它分两部分。

物理语言分词器把一段视频的状态转移压成离散序列。它不做整段视频的全局表示,而是显式建模每一对相邻隐状态之间的转移:用共享的 Q-Former 对每对相邻状态抽出一组转移特征,按时间顺序拼起来,再用有限标量量化(FSQ)离散化。FSQ 用标量量化层的笛卡尔积当词表,不需要单独学 codebook,这里词表 25K 个符号,一段 33 帧视频编码成 256 个 token 的物理语言序列。一个预训练好的扩散解码器(Wan2.2-5B)拿物理语言序列加第一帧当条件,重建原视频。第一帧负责静态外观,这样离散瓶颈就被逼着去编码「状态变化」而不是冗余的静态细节。

物理语言推理器是一个自回归 VLM(Qwen3-VL-4B),给定第一帧和一句文本动作意图,预测出对应的物理语言序列,再由训好的扩散解码器渲染成未来视频。整体因式分解成「推理物理语言」和「渲染视频」两步,把动态推理从像素合成里拆开。

数据上,从 5 万小时野外视频筛到约 1 万小时做分词器预训练,加上 1 千小时仿真视频,推理器 SFT 用 500 万筛到 100 万条 4 秒片段。

结果

生成和理解两侧都测。生成侧三个基准:Physics-IQ Verified(物理结果保真度)、PhyGround(物理定律遵循)、WorldModelBench(通用世界建模)。PhiZero 在三个上都拿第一:IQ-Score 41.2,超过 Cosmos3-Super 的 39.5、Grok-Video 34.8、Sora 2 的 26.5;PhyGround 物理分 3.01、Overall 2.97 全场最高;WorldModelBench Total 8.19 第一。

基准最强对照PhiZero
Physics-IQ Verified(IQ-Score)39.5(Cosmos3-Super)41.2
PhyGround(Overall)2.95(Wan2.2-14B)2.97
IntPhys2(直觉物理)55.63(Gemini-2.5 Flash)56.34

理解侧三个基准也都有竞争力:IntPhys2 直觉物理 56.34 超过 Gemini-2.5 Flash 的 55.63 和 GPT-4o 的 53.75;LikePhys 物理合理性判别平均误差 41.7 全场最低;YoCausal 真实因果理解聚合排名 2.0 第一。理解任务用似然比较:把一对视频都编码成物理语言序列,算在推理器下的对数似然,选似然高的那个当「物理有效」。

分词器本身的重建质量也说明问题:256 个 token,PSNR 28.9,比 VideoFlexTok(288 token、25.2)更高,远比 Wan2.2 VAE 的 44800 个连续 token 紧凑。PhiZero 还展示了动作条件下的驾驶和机器人世界模型,以及零样本动作迁移:把人体运动迁到 G1 人形机器人、手部运动迁到 Sharpa 灵巧手。

为什么重要

对做世界模型和 Physical AI 的人,PhiZero 给了一个清晰的不同于「纯像素预测」的路径:把动态推理从像素空间挪到一个学来的离散物理语言里。物理语言既是生成世界的中间表示,又能反过来做视频理解(判别物理是否合理),一套表示两头用,这是纯像素模型做不到的。

它的可迁移性也开了条路:状态转移模式是从大规模人类视频中抽象出来的,作者提到这些模式有可能迁到机器人 embodiment,缓解真机交互数据稀缺。这对想用人类视频数据训练机器人的方向有吸引力。

局限与存疑

论文自己点了三条。第一,物理语言是状态转移的经验表示,不是符号化的物理定律,离散符号还没有直接锚定可解释的物理变量或形式化定律。第二,从观察视频学来,覆盖受限于训练数据里能被视觉观测到的东西,触觉交互、微观粒子动力学这类视觉难捕捉的就难建模。第三,受限于数据和算力,当前模型规模偏小、训练语料相对物理世界的多样性仍有限。

更深的存疑:物理语言是数据驱动的,它学到的「物理」到底有多接近真物理,还是只是在视觉上像物理,论文用基准分数间接证明,但缺对这套表示到底编码了哪些物理量(质量、动量、摩擦?)的可解释分析。零样本迁移到机器人是个很诱人的展望,但目前只是定性展示,没有在真机任务上量化验证迁移有效性。固定时长片段的限制也还在,长时程世界建模需要层次化或循环预测,作者列为未来工作。

术语

原文与代码

相关论文

全部论文解读