PhiZero: A World Model Built Around Physical Language
Shuyao Shang, Yuqi Wang, Ruopeng Gao, Xu Chen, Tieniu Tan, Lue Fan, Zhaoxiang Zhang
cs.CV
2026-07-31
PhiZero 从野外视频自监督学出一种离散「物理语言」刻画状态转移,先推理出物理语言序列再渲染成视频。Physics-IQ Verified 拿到 41.2 分,超过 Sora 2、Cosmos3-Super 等。
视频世界模型能生成高保真画面,被当成物理世界的模拟器来用。但主流做法是直接在像素空间预测未来,世界的物理动态被隐含在高维视觉预测器里,经常生成物理上不自洽的结果:球撞了鸭子鸭子不动,碰撞没有后果。
人类从视觉经验里抽象出「世界怎么演化」的规律,再用语言组织、显式推理,并不逐帧死记画面。自然语言在数字世界很好用,但用来描述物理世界的状态转移太粗。PhiZero 的问题是:能不能学一种比自然语言更细粒度的「物理语言」,用来显式推理世界演化?
PhiZero 用「先推理再渲染」(reason-then-render)的范式,核心是自监督学出一种离散的物理语言,刻画视频里的状态转移。它分两部分。
物理语言分词器把一段视频的状态转移压成离散序列。它不做整段视频的全局表示,而是显式建模每一对相邻隐状态之间的转移:用共享的 Q-Former 对每对相邻状态抽出一组转移特征,按时间顺序拼起来,再用有限标量量化(FSQ)离散化。FSQ 用标量量化层的笛卡尔积当词表,不需要单独学 codebook,这里词表 25K 个符号,一段 33 帧视频编码成 256 个 token 的物理语言序列。一个预训练好的扩散解码器(Wan2.2-5B)拿物理语言序列加第一帧当条件,重建原视频。第一帧负责静态外观,这样离散瓶颈就被逼着去编码「状态变化」而不是冗余的静态细节。
物理语言推理器是一个自回归 VLM(Qwen3-VL-4B),给定第一帧和一句文本动作意图,预测出对应的物理语言序列,再由训好的扩散解码器渲染成未来视频。整体因式分解成「推理物理语言」和「渲染视频」两步,把动态推理从像素合成里拆开。
数据上,从 5 万小时野外视频筛到约 1 万小时做分词器预训练,加上 1 千小时仿真视频,推理器 SFT 用 500 万筛到 100 万条 4 秒片段。
生成和理解两侧都测。生成侧三个基准:Physics-IQ Verified(物理结果保真度)、PhyGround(物理定律遵循)、WorldModelBench(通用世界建模)。PhiZero 在三个上都拿第一:IQ-Score 41.2,超过 Cosmos3-Super 的 39.5、Grok-Video 34.8、Sora 2 的 26.5;PhyGround 物理分 3.01、Overall 2.97 全场最高;WorldModelBench Total 8.19 第一。
| 基准 | 最强对照 | PhiZero |
| Physics-IQ Verified(IQ-Score) | 39.5(Cosmos3-Super) | 41.2 |
| PhyGround(Overall) | 2.95(Wan2.2-14B) | 2.97 |
| IntPhys2(直觉物理) | 55.63(Gemini-2.5 Flash) | 56.34 |
理解侧三个基准也都有竞争力:IntPhys2 直觉物理 56.34 超过 Gemini-2.5 Flash 的 55.63 和 GPT-4o 的 53.75;LikePhys 物理合理性判别平均误差 41.7 全场最低;YoCausal 真实因果理解聚合排名 2.0 第一。理解任务用似然比较:把一对视频都编码成物理语言序列,算在推理器下的对数似然,选似然高的那个当「物理有效」。
分词器本身的重建质量也说明问题:256 个 token,PSNR 28.9,比 VideoFlexTok(288 token、25.2)更高,远比 Wan2.2 VAE 的 44800 个连续 token 紧凑。PhiZero 还展示了动作条件下的驾驶和机器人世界模型,以及零样本动作迁移:把人体运动迁到 G1 人形机器人、手部运动迁到 Sharpa 灵巧手。
对做世界模型和 Physical AI 的人,PhiZero 给了一个清晰的不同于「纯像素预测」的路径:把动态推理从像素空间挪到一个学来的离散物理语言里。物理语言既是生成世界的中间表示,又能反过来做视频理解(判别物理是否合理),一套表示两头用,这是纯像素模型做不到的。
它的可迁移性也开了条路:状态转移模式是从大规模人类视频中抽象出来的,作者提到这些模式有可能迁到机器人 embodiment,缓解真机交互数据稀缺。这对想用人类视频数据训练机器人的方向有吸引力。
论文自己点了三条。第一,物理语言是状态转移的经验表示,不是符号化的物理定律,离散符号还没有直接锚定可解释的物理变量或形式化定律。第二,从观察视频学来,覆盖受限于训练数据里能被视觉观测到的东西,触觉交互、微观粒子动力学这类视觉难捕捉的就难建模。第三,受限于数据和算力,当前模型规模偏小、训练语料相对物理世界的多样性仍有限。
更深的存疑:物理语言是数据驱动的,它学到的「物理」到底有多接近真物理,还是只是在视觉上像物理,论文用基准分数间接证明,但缺对这套表示到底编码了哪些物理量(质量、动量、摩擦?)的可解释分析。零样本迁移到机器人是个很诱人的展望,但目前只是定性展示,没有在真机任务上量化验证迁移有效性。固定时长片段的限制也还在,长时程世界建模需要层次化或循环预测,作者列为未来工作。