Apple-$π$: Benchmarking Thinking with Video Towards Law-Grounded Physical Intelligence
Runmao Yao, Kairui Hu, Yukang Cao, Ruisi Wang, Shulin Tian, Ziang Cao, Weichen Fan, Ziqi Huang, Yuhao Dong, Hao Li, Zhaoxi Chen, Zhongang Cai, Lei Yang, Ziwei Liu
cs.CV
2026-07-18
Apple-π 拿经典力学的 400 段视频,用「感知→列式→推演」三阶段评测 11 个视频模型能否按物理定律推理,最好的视频生成模型 Seedance 2.0 只拿到 0.473,暴露出感知能过、推演过不去的瓶颈。
视频生成模型现在被吹成「世界模型」,言下之意是它内化了物理规律。但现有基准只看最终画面合不合理,不验证模型是不是真的按物理定律推出来的。画面看着对,可能是真懂力学,也可能是凑出个像样的结果。Apple-π 想回答的就是:视频模型推理时,是像牛顿那样走物理定律,还是像亚里士多德那样凭直觉。(名字里的 Apple 是牛顿苹果的谐音梗,不是那家公司。)
Apple-π 有三块。第一块是数据集 Orchard:400 段视频覆盖经典力学的十个任务,来源分仿真(243 例)、自录真实场景(121 例)、网络素材(36 例)三类;任务按定律分两条枝,单定律枝用来做无混淆的诊断,多定律枝测泛化;三个支柱是万有引力、动量守恒、牛顿第一定律,物体只用球、立方体、圆柱、圆锥四种基本几何。
第二块是评测协议,分感知、列式、推演三阶段。输入是带信息图标注的首帧,模型要按链式帧(chain-of-frames)逐步生成视频,把生成过程当成它「看得见的推理轨迹」。感知阶段认物理量和物体位置,列式阶段选定律并预测目标状态,推演阶段生成与定律一致的运动轨迹。
第三块是评测套件:MLLM 主观打分看格式合规,物理定律锚定的客观指标看 Mask IoU、时空 IoU、速度准确度。这套组合不只判断模型对不对,还能定位它卡在哪一阶段。
评测了 11 个模型,5 个视频生成、6 个统一理解生成模型:
| 模型类型 | 最佳 | 分数 |
| 视频生成 | Seedance 2.0 | 0.473 |
| 统一模型 | GPT Image 2 | 0.704 |
| 统一模型 | Nano Banana 2 | 0.699 |
三个最关键的发现都指向同一件事:模型离可靠的物理世界模拟器还很远。第一,分数沿感知→列式→推演逐级下滑,感知能过、列式勉强、推演塌方,说明中间步骤的成功传不到时间一致的动力学上。第二,多定律任务明显比单定律难,模型在定律切换时传递不过去物理状态。第三,仿真到真实的 sim-to-real 差距在所有模型上都有,真实视觉条件下的定位和追踪是弱项。
对做视频生成和世界模型的人,Apple-π 给的是一个诊断框架,不是排行榜。它能告诉你模型到底死在哪一步,比单看最终画面的分数有用得多。核心结论是个测量学提醒:现在那些「世界模型」的高分,有不少可能是被最终画面的合理度撑起来的,而不是真的会物理推理。
物理范围只到经典力学,没碰电磁、流体这些。物体词表只有四种基本几何体,离真实世界的复杂物体很远。评测只用单相机视角,输入接口固定。客观指标测的是定律一致性,不测整体视觉保真度。真实视频的 ground truth 有测量噪声,跨不同帧率还做了时间归一化的假设。模型选了 11 个,覆盖面有限。