SpaceCast-Bench:最强 VLM 预测性空间推理仅 58%,远逊人类 87.2%

zju · hf · 2026-10-09

浙大团队推出 SpaceCast-Bench,首个直接诊断 VLM「预测性空间推理」的基准:不同于只读取输入中可见关系的空间感知测试,它要求模型从观察构建场景、预测干预后的变化并推理未观测结果。

基准采用「观察-变换-推断」框架,来自 182 个真实场景的 3862 道题,分静态感知、局部预测、全局预测三层共 16 种任务。评测 21 个模型发现:最强模型仅 58.0%,人类为 87.2%,而空间专精模型接近随机水平。控制实验显示「桥接视角」对整合分布式观察至关重要,显式 3D 证据比生成的结果图/视频更可靠。用程序化生成数据微调可将 Qwen3-VL-4B 从 34.0% 提到 65.7%,并在 6 个域外基准有宏观提升。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →