Astra 与 Fable 5.1 评测基准几乎不重叠

相隔几天发布的 Astra 与 Fable 5.1 各自发布的 benchmark 表都显示自家模型全面获胜,引发 Reddit 用户质疑。经对比分析发现,两家并未造假,而是选择了几乎不重叠的评测基准:OpenAI 主打 computer use 等方向的测试,Anthropic 则侧重另一套基准,导致分数无法直接比较。

2026-09-10 ~ 2026-09-10 · 2 条相关