Astra 跑分碾压却在 Arena 静止,Artificial Analysis 榜单遭质疑
brandon_galang · x · 2026-09-04
brandongalang 引用 theo 的推文质疑 Artificial Analysis 的智能指数可信度:theo 发现 GPT-6 Astra 在该指数上竟然落后于 MUSE SPARK 1.3 MAX,这与 Astra 在各家官方 benchmark 上的碾压式表现严重不符。
brandon 补充表示无法理解 Astra 如何在所有「据称的 benchmark」上全面领先,却在 Arena 上表现平平、分数原地不动,并宣布「不再把 Artificial Analysis 指数当回事」。
这轮争议核心是第三方榜单的取样与加权方法是否失真,还是模型存在针对 benchmark 的过拟合,尚无定论。
所属事件:GPT-6 Astra 第三方榜单表现遭社区集中质疑(6 条相关)→
「模型」频道最新
- OpenAI Astra 可自动布局与布线 PCB,工程师热议影响 — MikePFrank · 2026-09-04
- Ethan Mollick 实测 Astra:给它模糊需求,它自己拆任务就开干 — emollick · 2026-09-04
- 「AGI is 74% deepswe」:GPT-6-Astra 榜单成绩刷屏成梗 — amaarora · 2026-09-04
- 曝 Grok 4.7 数日内发布,据称用 SpaceX 工程数据补充训练 — XFreeze · 2026-09-04
- 前 OpenAI 安全副总裁:对 AI 进展不感到担忧就是误判形势 — Miles_Brundage · 2026-09-04
- Gary Marcus 评 GPT-6 Astra:符号世界模型是进步但远非 AGI — GaryMarcus · 2026-09-04