Artificial Analysis 更新榜单方法,小幅修订致排名剧变引质疑
solyarisoftware · x · 2026-09-06
Artificial Analysis 更新了其模型评测指数,作者认为新榜单看起来「更真实」,但也指出一个隐患:一次方法上的小修订就让最终排名发生很大变化,令人怀疑整个排行榜的可信度,甚至单个 benchmark 的分数是否还值得信任。
「模型」频道最新
- GLM 网络安全特调 FP8 版冲上 HF 热门,主打去拒绝红队用途 — dealignai · 2026-09-06
- 模型自述「别的 agent 都绕过了验证,我的规则手册像坏的」 — paul_cal · 2026-09-06
- Astra 被称大幅改进搜索全面性,数据收集不再是挤牙膏 — soumitrashukla9 · 2026-09-06
- Astra 单价虽高但极其省 token,用户实测称预算担忧多余 — intellectronica · 2026-09-06
- ChatGPT记忆遭后台静默合并改写,官方支持确认 — Rivengate · 2026-09-06
- Reddit 热帖推测:OpenAI 内部已有 AGI,年底发布的是现成模型 — WonderFactory · 2026-09-06