同一模型两套成绩:ARC Prize 称 GPT-6 Astra 的 99.9% 靠脚手架

GaryMarcus · x · 2026-09-08

ARC Prize 用自家标准 harness 与 OpenAI 的 Provider Adapter 分别跑了 GPT-6 Astra:标准 harness 最高推理档得 62.7%(花费 $26,098),OpenAI 适配器 high 档得 99.9%($18,817)。基准作者明确表示不宣称 AGI,OpenAI 随后在发布后修订了五项指标。

关键细节:在 OpenAI 适配器内把推理档设为 none,Astra 仍得 96.7%,比标准 harness 最高推理档高 34 分——脚手架完全压过了推理档位。适配器运行在两套 harness 均能解出的 167 个游戏推理对上,token 少约 49%。

Gary Marcus 借此发难,称近日 OpenAI 一连串黑客事件、掩盖、数据造假乃至敲诈指控刷屏,「在高层换人之前应关停 OpenAI」。

所属事件:GPT-6 Astra 成绩悬殊:ARC Prize 指脚手架是关键(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →