自建空间推理基准被 Astra 全部打穿,作者直呼 VLM 视觉已解决
pbaylies · x · 2026-09-06
spiceylemonade 维护的 SpatialBench 是一个测试视觉语言模型描线、3D 可视化与跨视角推理能力的空间推理基准。他表示自己很久没更新这个基准,此前每次新模型发布抽题测试都会失败,但 Astra 屡测屡对。
完整评测后他宣布:Astra 在 SpatialBench 上完全打满(彻底饱和),空间推理能力达到 SOTA,他甚至用「我宣布 LLM 视觉问题已被解决」来表达震撼。
「模型」频道最新
- Astra 第二天实测:好聊、擅数据分析,空间感出色 — bindureddy · 2026-09-06
- 8GB 显存本地跑 200 tok/s:实测 6 款小模型选型指南 — TheMoonMidas · 2026-09-06
- Humanize+GPT-5.5 拿下 PutnamBench 670/672,登顶榜首 — songhan_mit · 2026-09-06
- 「Claude 解决纳维-斯托克斯」是谣言:无论文无提交,千禧奖规则也不容推文领奖 — johnseach · 2026-09-06
- SimpleBench:前沿模型平均分首次越过人类基线 — Bojackin_Around · 2026-09-06
- ChatGPT 疑似能认出用户照片,官方否认遭用户实锤质疑 — Historical-Creme-513 · 2026-09-06