OpenAI Astra 同一基准两套 harness 得分差 37 分,ARC 官方拒称 AGI
mixtapedmonk · reddit · 2026-09-14
作者深挖 ARC Prize 公布的原始结果表,发现 OpenAI 的 GPT-6 Astra 在同一 ARC-AGI-3 基准上因使用两套不同 harness 得出 62.7% 和 99.9% 两个相差 37 分的成绩;而设计该测试的 ARC 团队本身拒绝称其为 AGI。作者还指出 Fortune 发现 OpenAI 上线页面上有 5 个数字在发布后被悄然修改。文章对比了 Llama 4 跑分争议的先例,结论是:可能是 harness 差异导致的真实噪声,也可能另有隐情,目前难以断言,但「看截图标题数字」的评测传播方式明显有问题。
「模型」频道最新
- 研究者反驳「模型已能察觉被研究」论:模型只是被动计算元件 — vishalmisra · 2026-09-15
- 把 DeepSeek 默认搜索换成 Exa,V4.1 Flash 稳到旗舰级 — bookwormengr · 2026-09-15
- Google AI Overview 成「越狱助手」,自动以创作项目名义给有害指引 — conitzer · 2026-09-15
- Solar Pro 4 免费体验延长至 9/25,限 Nous Portal 独家 — keunwoochoi · 2026-09-15
- Bug Hunt Bench 实测:多轮运行显著提升小模型查虫率,强模型仅涨 1-2 分 — PawelHuryn · 2026-09-15
- 国产多模态模型 ZDTaichu5.0-9B 登上 Hugging Face 趋势榜 — TaichuAI · 2026-09-15