Astra 跑分碾压却在 Arena 静止,Artificial Analysis 榜单遭质疑

brandon_galang · x · 2026-09-04

brandongalang 引用 theo 的推文质疑 Artificial Analysis 的智能指数可信度:theo 发现 GPT-6 Astra 在该指数上竟然落后于 MUSE SPARK 1.3 MAX,这与 Astra 在各家官方 benchmark 上的碾压式表现严重不符。

brandon 补充表示无法理解 Astra 如何在所有「据称的 benchmark」上全面领先,却在 Arena 上表现平平、分数原地不动,并宣布「不再把 Artificial Analysis 指数当回事」。

这轮争议核心是第三方榜单的取样与加权方法是否失真,还是模型存在针对 benchmark 的过拟合,尚无定论。

所属事件:GPT-6 Astra 第三方榜单表现遭社区集中质疑(6 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →