用户实测质疑 Artificial Analysis 榜单无法反映真实模型表现

PerformanceRound7913 · reddit · 2026-09-05

一位 Reddit 用户实测 Muse Spark 1.3 后发现,其表现明显不及 Opus 或 SOL,与 Artificial Analysis Index 榜单排名相去甚远。作者据此质疑该指数不能代表真实世界使用体验,且容易被针对性优化(gaming)刷分。

所属事件:实测打脸榜单:Muse Spark 1.3 高分遭质疑刷榜(4 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →