SpaceCast-Bench:最强 VLM 预测性空间推理仅 58%,远逊人类 87.2%
zju · hf · 2026-10-09
浙大团队推出 SpaceCast-Bench,首个直接诊断 VLM「预测性空间推理」的基准:不同于只读取输入中可见关系的空间感知测试,它要求模型从观察构建场景、预测干预后的变化并推理未观测结果。
基准采用「观察-变换-推断」框架,来自 182 个真实场景的 3862 道题,分静态感知、局部预测、全局预测三层共 16 种任务。评测 21 个模型发现:最强模型仅 58.0%,人类为 87.2%,而空间专精模型接近随机水平。控制实验显示「桥接视角」对整合分布式观察至关重要,显式 3D 证据比生成的结果图/视频更可靠。用程序化生成数据微调可将 Qwen3-VL-4B 从 34.0% 提到 65.7%,并在 6 个域外基准有宏观提升。
「模型」频道最新
- AI 没破解 RSA-2048?网友质疑 OpenAI 只是没公开内部结果 — ChrisGPT · 2026-10-09
- OpenAI 释出 719 篇数学证明,西方开源模型齐发对抗中国 — Last Week in AI · 2026-10-09
- 开源 NSFW 图像分类器 Blue-Eye 跑分 88.9%,胜过 AWS 与 Google Vision — Mundane_Toe_8074 · 2026-10-09
- 「套壳」批评正在失效:Genspark 定制 MiniMax 模型做演示文稿 — polopat96 · 2026-10-09
- 评测显示所有模型都差?作者发现答案密钥取错了时间点 — jgarg27 · 2026-10-09
- Ai2 高管回应质疑:下一代 Olmo 模型已在训练,全面开源路线不变 — sewon__min · 2026-10-09