GST-Bench: Can VLMs Develop Global Spatial Awareness from Video?
Qifeng Zhang, Kaixiang Huang, Heng Dong, Huang Fang, Junting Chen, Junjie Zhu, Yonghang Chen, Zhiyu Zhang, Wei Li
cs.CV
2026-08-06
用 6,790 分钟合成视频搭的 GST-Bench 测 22 个 VLM,最强的 Gemini-3-Pro 只得 42.68,人类 79.08;瓶颈是跨帧空间整合而非单图感知,微调 Qwen3-VL-8B 能把分数从 25.89 拉到 53.52。
家用机器人要去厨房拿个东西,得边走边把房间记进脑子,记住物件在哪、它们彼此什么方位,哪怕此刻不在视野里。这种全局空间感,人毫不费力,却是当下 VLM(vision-language model,视觉语言模型)的硬伤。已有的空间基准大多盯着单张图或两三张图,问的是「A 在 B 左边还是右边」,考的是局部感知。ByteDance Seed 团队要测的是另一件事:看完一段长视频漫游后,能不能拼出整间屋子的全局布局,并据此设计了一个强制跨帧推理的基准。
基准围绕三个问题展开:本体在哪(自定位)、目标在哪(物体定位)、屋子长什么样(场景结构),拆成 12 个子任务。它有几条刻意的反作弊设计。第一,所有物体定位任务里,目标物件在当前查询视角必然不可见,模型只能靠视频里的历史记忆推断,不能靠单帧识别。第二,查询视角是从视频轨迹之外的独立点采样来的,逐帧匹配这条路也被堵死。第三,打分用精确数值,包括距离、角度、俯视图上的点位,而不是「左右前后」这种粗糙类别。数据用 OmniGibson 加 BEHAVIOR-1K 仿真器自动生成,覆盖 50 个室内场景,产出 6,790 分钟视频和 2,762 道人工核验过的题。
| 模型 | GST-Bench 均分 | 备注 |
| 人类 | 79.08 | 每任务 20 题 |
| Gemini-3-Pro | 42.68 | 最强零样本 |
| Gemini-2.5-Pro | 40.95 | |
| GPT-5 | 40.85 | |
| InternVL3.5-38B | 30.71 | 最强开源 |
| 随机猜测 | 20.01 | |
| Qwen3-VL-8B(微调后) | 53.52 | 用 GST-Train |
差距普遍且巨大。最强的 Gemini-3-Pro 离人类差 36.4 分,在朝向估计上最强专有模型也才 21.52,人类 85.00。开源阵营基本贴着随机线,九个开源和具身模型里有九个落在随机基线三分以内。一个反直觉的发现:RoboBrain、Cosmos-Reason2 这些专门为具身场景微调过的模型,成绩并不比同规模通用模型好,反而继承了同样的全局推理盲区。
它把「局部看得见」和「全局拼得起来」两件事拆开了。团队做了对照实验:把目标物件放回当前视角,退化成单图任务,Gemini-3-Pro 在自定位方向任务上分数从 22 涨到 61,涨了 39 分。这说明专有模型的瓶颈不在单图感知,而在跨帧空间整合;开源模型两头都弱。这个切分对做机器人和具身智能的人是直接的诊断信号:你模型离人类那 36 分的缺口,大半来自「记不住、对不齐」,而不是「看不清」。微调能补一部分,Qwen3-VL-8B 在 GST-Train 上微调后从 25.89 升到 53.52,超过所有零样本专有模型,但离人类还差 25 分。
数据全靠仿真器生成,和真实世界的光照、遮挡、噪声有差距;俯视图这种输入在真实部署里往往拿不到。人类基线每任务只测 20 题,样本偏小。作者自己承认微调只缩小了差距没解决差距。一个没被深究的点:具身模型成绩差,到底是训练配方的问题(强调局部 affordance 而非长程空间记忆),还是这些模型本就不该被期待擅长这种上帝视角任务,论文只给了推测。