Reddit 用户质疑 Artificial Analysis 数据可信:同一模型同榜分数不一

metigue · reddit · 2026-09-04

一位 Reddit 用户发文质疑模型评测聚合站 Artificial Analysis 的数据可信度:他为查证 Astra 模型新出的 61 分去细看结果,发现同一模型在同一 benchmark 的不同页面上分数不一致,且某些分数与 benchmark 官方验证结果直接矛盾。作者据此认为该站已不可作为数据来源。

同时他吐槽另一个问题:DeepSWE、terminal bench 等直连 benchmark 的最新版本缺少大量模型条目,尤其是开源模型,导致寻找替代评测来源也很困难。作者向社区征集更好的模型对比评测渠道。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →