开发者自建 AtlasBench 空间推理基准,GPT-6.1 登顶 84.7%

flowersslop · x · 2026-10-03

开发者 @flowersslop 用 vibecoding 方式自建了 AtlasBench Europe,一个针对真实欧洲地点、路线和地形的空间推理基准,覆盖 20 国,题型包括距离、方位角、排序、比例和驾驶距离。

实测结果:GPT-6.1 Sol Pro 以 84.67% 居首,GPT-6 Astra(83.33%)和 Claude Fable 5.1(80%)紧随其后;GPT-4 Turbo 仅 15.33%,GPT-3.5 Turbo 7.33%。作者指出问题在于 Astra 和 Fable 几乎能饱和任何基准,若模型逼近 100% 会再增加国家和题目。

基准网站已上线,可直接浏览各题与模型表现。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →