从业者吐槽:AA 等模型评测指数与真实体验脱节日益严重

HarveenChadha · x · 2026-09-05

Harveen Chadha 发帖提醒:评测分数并不代表用户体验和真实使用情况。他举例称,当 Opus 5 在 AA(Artificial Analysis)指数上得分超过 Fable 5 的那天,他就不再相信 AA 指数了;而 Muse Spark 1.3 能在榜上压过 Astra,更让他觉得该指数「一天比一天离谱」。核心观点:榜单排名与实际体感的错位正在加剧,选模型别只看跑分。

所属事件:实测打脸榜单:Muse Spark 1.3 高分遭质疑刷榜(4 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →