OpenAI 与 Anthropic 评测表都全胜?拆解后两边都没造假

Ahmiii_83 · reddit · 2026-09-10

astra 与 fable 5.1 相隔三天发布,双方基准表各自全胜。作者分析后发现两家并未造假,只是跑了几乎不重叠的基准:OpenAI 主打 computer use(osworld)和数学(frontiermath t4),Anthropic 主打编码与终端(terminal bench 4.0、cursorbench、swe bench pro),根本没有可对读的正面交锋。

更值得警惕的是 harness 差异:OpenAI 报的 arc-agi-3 99.9% 来自自建 provider adapter(跨步骤保留推理状态),而标准 harness 下同一模型仅 62.7%。Artificial Analysis 统一条件下测得 fable 智能指数 66、astra 61,编码 agent 指数 70 vs 67——只差 5 分,远非厂商表格呈现的碾压。

作者引旧例佐证「谁出题谁得利」并非新事:

结论:表格由被测方构建,「谁跑的、在什么条件下跑的」比「跑出多少分」更有用。

所属事件:Astra 与 Fable 5.1 评测基准几乎不重叠(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →