用户实测质疑 Artificial Analysis 榜单:高分模型实战远逊 Opus

PerformanceRound7913 · reddit · 2026-09-05

一位用户实测 Muse Spark 1.3 后发现,其实际表现明显不及 Opus 和 SOL 等模型,与其在 Artificial Analysis Index 上的高分不符,认为该榜单无法代表真实世界性能、容易被刷分。发帖引发对第三方评测榜单可信度的讨论。

所属事件:用户实测质疑 Muse Spark 1.3 榜单成绩涉嫌虚高(4 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →