Astra 与 Fable 5.1 评测基准几乎不重叠
相隔几天发布的 Astra 与 Fable 5.1 各自发布的 benchmark 表都显示自家模型全面获胜,引发 Reddit 用户质疑。经对比分析发现,两家并未造假,而是选择了几乎不重叠的评测基准:OpenAI 主打 computer use 等方向的测试,Anthropic 则侧重另一套基准,导致分数无法直接比较。
2026-09-10 ~ 2026-09-10 · 2 条相关
- OpenAI 与 Anthropic 评测表都全胜?拆解后两边都没造假 — Ahmiii_83 · 2026-09-10
- Astra 与 Fable 5.1 榜单几乎不重叠,基准分数其实没法直接比 — recro69 · 2026-09-10