Anthropic 一跑差分数,基准就更难让人信了

teortaxesTex · x · 2026-07-25

用一句梗话概括了这类基准分数的“信任危机”:只要 Anthropic 在某个 benchmark 上表现一般,大家就更容易怀疑这个 benchmark 没那么靠谱。

配图里是在讨论 Opus 5 的 ECI:有人认为它应在 163.5 左右,理由是基于公开基准和 Anthropic 自己给出的信息;图中还提到 内部 AECl 为 162.1,甚至高于 Mythos 5。原帖最后的意思是:公共基准还得更难一点,不然太容易被解读或被“玩”明白。

所属事件:Anthropic 基准测试表现引发社区信任危机(2 条相关)→

原文链接 →

「Fun」频道最新

更多「Fun」频道 AI 资讯 →