Apple-π 基准测试:视频模型物理推理能力仍存短板
Apple-π(Apple-PI)是一个全新提出的基准测试,旨在评估视频生成模型能否基于显式物理定律进行推理,而非仅仅评估画面的逼真度。该基准要求模型经历从感知到公式化再到推导的过程,以可审计的方式检验其“物理智能”。测试结果表明,当前视频模型在充当世界模拟器方面仍面临显著局限。
已确认
该基准包含一个名为 Orchard 的数据集,由 400 个视频组成,覆盖了 10 个不同的物理概念。在对 11 个视频模型进行评测后,发现表现最好的模型物理推理准确率也仅为 0.473。目前,该项目的相关论文、项目页面和代码均已公开。
为什么重要
当前业界大量探讨视频生成模型作为“世界模拟器”的潜力。Apple-π 提供了一个标准化的诊断工具,揭示了即便视频生成得再逼真,模型在底层物理逻辑推理上依然存在明显短板,这为未来提升视频模型的物理一致性指明了方向。
2026-07-24 ~ 2026-07-25 · 5 条相关
一手来源
- Apple-PI 评测 11 个视频模型物理推理,最好仅 0.473 — _akhaliq ·
- 【源头】Apple-PI 评测 11 个视频模型物理推理,最好仅 0.473 — _akhaliq · 2026-07-24
- Apple-π 评估视频生成模型能否充当世界模拟器 — _akhaliq · 2026-07-24
- Apple-π 用物理定律推理评测视频模型 — ziqi_huang_ · 2026-07-25