中科大发布 PhysVista 基准:VLM 物理理解远落后于视觉识别
ustc · hf · 2026-10-02
中科大团队在 Hugging Face 发布 PhysVista 基准,通过「感知-推理-评估」闭环框架评测视觉语言模型(VLM)的物理智能。
核心设计:
- 联合评测物理状态感知、物理动力学推理、物理合理性判断三个认知环节,弥补现有基准碎片化评测的不足;
- 区分事件级与尺度级推理,支持细粒度分析;
- 同时纳入真实视频与 AI 生成视频,可检验模型能否识别生成内容的物理失真。
实验发现:各主流 VLM 在物理推理与合理性评估上均存在显著局限,视觉识别能力与真正物理理解之间存在持续鸿沟。
「多模态」频道最新
- 4D Ride:威尔史密斯意面后的新一代 AI 视频评测基准 — Unlikely_Manager2495 · 2026-10-02
- Midjourney 实测:长曝光+低 stylize 拍出胶片电影感人像 — michaelrabone · 2026-10-02
- 提示词分享:三视图 3D 皮克斯风吉祥物一键生成 — azed_ai · 2026-10-02
- 开源 ComfyUI 插件:一键加载 Civitai 工作流并自动补齐缺失模型 — Zealousideal-Bee-300 · 2026-10-02
- AI 电影人之争:多数人把 LLM 用得太浅,电影级作品仍靠导演功力 — taherdhanera · 2026-10-02
- RTX 5090 实测:软件优化后 LTX 2.5 可生成 60 秒长视频 — OpenEffect3955 · 2026-10-02