Apple-PI 评测 11 个视频模型的物理推理上限仅 0.473
mmlab-ntu · hf · 2026-07-21
Apple-PI 用物理定律评测视频模型推理
这篇工作指出,现有视频基准大多只看结果像不像“符合物理”,却很少验证模型是否真的沿着可信的物理推理过程得到答案。为此,作者提出了一个明确锚定物理定律的视频模型基准 Apple-PI。
核心组成
- Orchard:包含 400 个视频,覆盖经典力学中的 10 类典型任务。
- 三阶段协议:感知 → 公式化 → 演绎,对应科学推理的流程。
- 使用带信息图标注的首帧进行 chain-of-frames 提示,把生成视频视为可见推理轨迹。
- 评测系统同时结合 MLLM 主观打分 和 物理定律约束的客观指标。
主要结论
- 对 11 个模型 的测试显示,最佳视频模型也只有 0.473。
- 模型在“感知→公式化→演绎”之间存在明显瓶颈。
- 多定律状态迁移能力仍然较弱。
- 结果表明,当前视频模型距离真正可靠的、基于物理定律的世界模拟器还有明显差距。
所属事件:Apple-π基准测试直击视频模型物理推理短板(3 条相关)→
「多模态」频道最新
- Gemini Omni Flash 把船舱直接改成了洞穴风格 — chrisfirst · 2026-07-22
- 用 Gemini、Grok 或 GPT Image 把照片转成提示词 — harshitagu72595 · 2026-07-22
- 有人想训练一个一致性 LoRA,让动漫场景保持统一 — ThirdWorldBoy21 · 2026-07-22
- 手绘手办丢进 Seedance,效果像真的“活过来” — cocktailpeanut · 2026-07-22
- 一个 AI agent 做出的沼泽乡村 MV 在 Reddit 上走红 — LazyKaleidoscope4696 · 2026-07-22
- 实测 Qwen 3 图像生成:地图边界随提问视角变化,自带中文标签 — NirantK · 2026-07-22