Astra 与 Fable 5.1 榜单几乎不重叠,基准分数其实没法直接比

recro69 · reddit · 2026-09-10

Reddit 用户指出,相隔几天发布的 Astra 和 Fable 5.1 各自的 benchmark 表都把自己模型显得很强,但仔细对比后却发现两套基准几乎不重叠:

作者认为两家实验室未必造假——数字可能都准确,但给人留下的印象截然不同。这引出一个更普遍的问题:大家在看模型对比时,到底是细看具体基准套件,还是只看厂商给出的总表?

所属事件:Astra 与 Fable 5.1 评测基准几乎不重叠(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →