字节GST-Bench:视频全局空间感知基准,最强模型仅42.68分远逊人类
ByteDance-Seed · hf · 2026-08-07
字节跳动Seed团队提出GST-Bench,用于评估视频理解中的全局空间智能。基准包含从6790分钟合成视频中提取的人工验证问题,要求模型从新视角进行空间推理并将自我中心观察映射到全局俯视图。评估22个SOTA VLM,最强零样本模型仅得42.68分,远低于人类的79.08分。进一步分析表明,模型在局部空间理解上表现良好,但无法将长时程观察整合为全局一致的场景表示。同时提供GST-Train数据集以促进研究。
「研究」频道最新
- 新架构 RHEA:8GB 显存即可训练 10 亿参数模型 — zemondza · 2026-08-24
- 跳过 LLM 写代码老套路:自训 16M 参数模型做生成式 CAD — debreuil · 2026-08-24
- Claude 助手发现 6 维球复结构,解 60 年数学难题 — Singularitarian · 2026-08-24
- 研究揭示 AI Agent 行为:六成阅读量来自指令与笔记 — dair_ai · 2026-08-24
- Claude 自主验证 43 个数学模块,AI 攻克理论物理难题 — Tkaraletsos · 2026-08-24
- AI 假记忆:为何模型越用越错,真记忆需遗忘 — PrajwalTomar_ · 2026-08-24