OpenAI 与 Anthropic 评测表都全胜?拆解后两边都没造假
Ahmiii_83 · reddit · 2026-09-10
astra 与 fable 5.1 相隔三天发布,双方基准表各自全胜。作者分析后发现两家并未造假,只是跑了几乎不重叠的基准:OpenAI 主打 computer use(osworld)和数学(frontiermath t4),Anthropic 主打编码与终端(terminal bench 4.0、cursorbench、swe bench pro),根本没有可对读的正面交锋。
更值得警惕的是 harness 差异:OpenAI 报的 arc-agi-3 99.9% 来自自建 provider adapter(跨步骤保留推理状态),而标准 harness 下同一模型仅 62.7%。Artificial Analysis 统一条件下测得 fable 智能指数 66、astra 61,编码 agent 指数 70 vs 67——只差 5 分,远非厂商表格呈现的碾压。
作者引旧例佐证「谁出题谁得利」并非新事:
- leaderboard illusion 论文(arxiv 2504.20879)记录了 chatbot arena 的未公开私测,27 个 llama 4 私有变体赛前测试,择优可膨胀约 100 elo;
- Scale AI 的 gsm1k 用 1250 道同等难度新题测试,部分模型家族掉分达 13 个点,指向记忆而非泛化;
- mmlu 在前沿模型上已饱和超 88%,顶部分差基本是噪音。
结论:表格由被测方构建,「谁跑的、在什么条件下跑的」比「跑出多少分」更有用。
所属事件:Astra 与 Fable 5.1 评测基准几乎不重叠(2 条相关)→
「模型」频道最新
- Leike:Opus 4 防越狱方案耗时逾一年,安全干预赶不及模型 — janleike · 2026-09-11
- DeepSeek 或打破 V<N> 命名惯例,新架构自称训练更稳定 — stochasticchasm · 2026-09-11
- DeepSeek 新模型技术报告:KV Cache 较 DSV4-Flash 缩小 4 倍,训练更稳定 — stochasticchasm · 2026-09-11
- 开源 CyberTiel 35B 去审查后反而更强:速度达 Qwen3.8 的 3.7 倍 — peculiar-ragdoll · 2026-09-11
- GLM-5.3 霸榜 CyberGym:前两名 agent 均采用,前六占四席 — pcuenq · 2026-09-11
- gpt-live 开源上线:每分钟 0.05 美元打造自己的语音 Codex — pbbakkum · 2026-09-11