OpenAI Astra 同一基准两套 harness 得分差 37 分,ARC 官方拒称 AGI

mixtapedmonk · reddit · 2026-09-14

作者深挖 ARC Prize 公布的原始结果表,发现 OpenAI 的 GPT-6 Astra 在同一 ARC-AGI-3 基准上因使用两套不同 harness 得出 62.7% 和 99.9% 两个相差 37 分的成绩;而设计该测试的 ARC 团队本身拒绝称其为 AGI。作者还指出 Fortune 发现 OpenAI 上线页面上有 5 个数字在发布后被悄然修改。文章对比了 Llama 4 跑分争议的先例,结论是:可能是 harness 差异导致的真实噪声,也可能另有隐情,目前难以断言,但「看截图标题数字」的评测传播方式明显有问题。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →