自建空间推理基准被 Astra 全部打穿,作者直呼 VLM 视觉已解决

pbaylies · x · 2026-09-06

spiceylemonade 维护的 SpatialBench 是一个测试视觉语言模型描线、3D 可视化与跨视角推理能力的空间推理基准。他表示自己很久没更新这个基准,此前每次新模型发布抽题测试都会失败,但 Astra 屡测屡对。

完整评测后他宣布:Astra 在 SpatialBench 上完全打满(彻底饱和),空间推理能力达到 SOTA,他甚至用「我宣布 LLM 视觉问题已被解决」来表达震撼。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →