GPT-5 时代的视觉基准被 Astra 刷到 97%,作者自测排除数据污染
adonis_singh · x · 2026-10-09
开发者 adonissingh 介绍其自建的视觉推理基准 eyebench:包含找不同、迷宫路径、拓扑等任务,题目完全私密,曾让当时的顶级视觉模型吃瘪。
如今 Astra 已将其饱和。为排除 OpenAI 通过 API 训练题目的可能,作者另生成了一套同类型新题测试,Astra 反而略高,达到 97%——说明模型是真正理解了任务,而非记忆题目。作者同时指出 Haiku 在 xhigh 与 max 档得分相同,使得 fable-5.1 与 haiku 之间的价格差距更显夸张。
「模型」频道最新
- Mistral 高管澄清:FrontierCode 由 Cognition 私有评测,样本不外泄 — b_roziere · 2026-10-09
- Google 把决策模型塞进 Chrome,实测与 Gemini Nano、Decisions API 对比 — gaganghotra_ · 2026-10-09
- 用户随手录 60 秒屏幕,Grok Bot 竟自动剪出像样的教程视频 — elonmusk · 2026-10-09
- Anthropic 使用条款被批「空泛到没有意义」:随时可封禁用户 — ivan_bezdomny · 2026-10-09
- 用户吐槽 codex 表现“如 GPT-3.5”:知识库更新后不重审结论 — Yamapama · 2026-10-09
- 置信度校准胜过准确率:Nimble 9B 自动化路由量达基座 2.7 倍 — AgitatedUsual8995 · 2026-10-09