开发者自建 AtlasBench 空间推理基准,GPT-6.1 登顶 84.7%
flowersslop · x · 2026-10-03
开发者 @flowersslop 用 vibecoding 方式自建了 AtlasBench Europe,一个针对真实欧洲地点、路线和地形的空间推理基准,覆盖 20 国,题型包括距离、方位角、排序、比例和驾驶距离。
实测结果:GPT-6.1 Sol Pro 以 84.67% 居首,GPT-6 Astra(83.33%)和 Claude Fable 5.1(80%)紧随其后;GPT-4 Turbo 仅 15.33%,GPT-3.5 Turbo 7.33%。作者指出问题在于 Astra 和 Fable 几乎能饱和任何基准,若模型逼近 100% 会再增加国家和题目。
基准网站已上线,可直接浏览各题与模型表现。
「模型」频道最新
- diagrams 站点新增 Kimi-K3 与 MiMo-V2.6-Pro 架构图 — vtabbott_ · 2026-10-03
- Jon Barron 回忆 Gemini 疯狂输出螺旋:多狂喜或乱码,3.6 Flash 后消失 — jon_barron · 2026-10-03
- 资深工程师:AI 编码质量已超人类,Opus 比我遇过的工程师都强 — facontidavide · 2026-10-03
- 用户吐槽 Grok 套餐无升级入口:付费订阅也未必能提升 Bot 额度 — JOBhakdi · 2026-10-03
- Vercel 发布 Python 版 AI SDK,实验性 evaluate() API 直连 Jev — cramforce · 2026-10-03
- ChatGPT Pro 用户控诉:周额度被提前强制重置作废 — Garbia · 2026-10-03