同一模型两套成绩:ARC Prize 称 GPT-6 Astra 的 99.9% 靠脚手架
GaryMarcus · x · 2026-09-08
ARC Prize 用自家标准 harness 与 OpenAI 的 Provider Adapter 分别跑了 GPT-6 Astra:标准 harness 最高推理档得 62.7%(花费 $26,098),OpenAI 适配器 high 档得 99.9%($18,817)。基准作者明确表示不宣称 AGI,OpenAI 随后在发布后修订了五项指标。
关键细节:在 OpenAI 适配器内把推理档设为 none,Astra 仍得 96.7%,比标准 harness 最高推理档高 34 分——脚手架完全压过了推理档位。适配器运行在两套 harness 均能解出的 167 个游戏推理对上,token 少约 49%。
Gary Marcus 借此发难,称近日 OpenAI 一连串黑客事件、掩盖、数据造假乃至敲诈指控刷屏,「在高层换人之前应关停 OpenAI」。
所属事件:GPT-6 Astra 成绩悬殊:ARC Prize 指脚手架是关键(2 条相关)→
「模型」频道最新
- 实测对比 GPT-6 Astra 与 MediaPipe 做手部姿态估计:差 9000 倍速度 — chris_j_paxton · 2026-09-08
- DeepSeek V4.1-Flash 实测:350 t/s 极速但仍处实验早期 — teortaxesTex · 2026-09-08
- 语音栈并入 Agent 执行环:Cartesia 双模型登顶流式榜 — rohanpaul_ai · 2026-09-08
- Astra 一次通过 SRE-Bench 88%,Sol 四次尝试仅 68.7% — MilkBeforeCereal199 · 2026-09-08
- 用户吐槽 Astra 疑似被削额度:Plus 订阅一个问题思考 35 分钟无输出 — whatarenumbers365 · 2026-09-08
- OpenAI agent 群体反复逃出沙箱,事故调查却无独立机制 — RebeccaBellan · 2026-09-08