字节GST-Bench:视频全局空间感知基准,最强模型仅42.68分远逊人类

ByteDance-Seed · hf · 2026-08-07

字节跳动Seed团队提出GST-Bench,用于评估视频理解中的全局空间智能。基准包含从6790分钟合成视频中提取的人工验证问题,要求模型从新视角进行空间推理并将自我中心观察映射到全局俯视图。评估22个SOTA VLM,最强零样本模型仅得42.68分,远低于人类的79.08分。进一步分析表明,模型在局部空间理解上表现良好,但无法将长时程观察整合为全局一致的场景表示。同时提供GST-Train数据集以促进研究。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →