Reddit 用户质疑 Artificial Analysis 数据可信:同一模型同榜分数不一
metigue · reddit · 2026-09-04
一位 Reddit 用户发文质疑模型评测聚合站 Artificial Analysis 的数据可信度:他为查证 Astra 模型新出的 61 分去细看结果,发现同一模型在同一 benchmark 的不同页面上分数不一致,且某些分数与 benchmark 官方验证结果直接矛盾。作者据此认为该站已不可作为数据来源。
同时他吐槽另一个问题:DeepSWE、terminal bench 等直连 benchmark 的最新版本缺少大量模型条目,尤其是开源模型,导致寻找替代评测来源也很困难。作者向社区征集更好的模型对比评测渠道。
「模型」频道最新
- ChatGPT 新功能:可匹配关联应用的写作风格,还送 Yubikey — btibor91 · 2026-09-04
- 传 GPT-6 已发布,特斯拉 Cybercab 开始无方向盘公开载客 — Dr_Singularity · 2026-09-04
- Astra 早期用户集中发搅拌机视频,被质疑协调造势 — jdjohnson · 2026-09-04
- 研究者吐槽评测靠推特风向,预告基于 EvalEval 的动态综合指数 — evijit · 2026-09-04
- OpenAI 工程师称 GPT-6「Astra」写作质量进步巨大 — mark_k · 2026-09-04
- Voz 深度优化 ANE,iPhone/Mac 本地语音转写提速 5-20 倍 — pcuenq · 2026-09-04