GPT-5 时代的视觉基准被 Astra 刷到 97%,作者自测排除数据污染

adonis_singh · x · 2026-10-09

开发者 adonissingh 介绍其自建的视觉推理基准 eyebench:包含找不同、迷宫路径、拓扑等任务,题目完全私密,曾让当时的顶级视觉模型吃瘪。

如今 Astra 已将其饱和。为排除 OpenAI 通过 API 训练题目的可能,作者另生成了一套同类型新题测试,Astra 反而略高,达到 97%——说明模型是真正理解了任务,而非记忆题目。作者同时指出 Haiku 在 xhigh 与 max 档得分相同,使得 fable-5.1 与 haiku 之间的价格差距更显夸张。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →