中科大发布 PhysVista 基准:VLM 物理理解远落后于视觉识别

ustc · hf · 2026-10-02

中科大团队在 Hugging Face 发布 PhysVista 基准,通过「感知-推理-评估」闭环框架评测视觉语言模型(VLM)的物理智能。

核心设计:

实验发现:各主流 VLM 在物理推理与合理性评估上均存在显著局限,视觉识别能力与真正物理理解之间存在持续鸿沟。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →