GPT-6 Astra 刷爆 ARC-AGI-3:换评测框架从 62.7% 跳到 99.9%

rohanpaul_ai · x · 2026-09-05

ARC Prize 官方宣布 OpenAI 的 GPT-6 Astra 在 ARC-AGI 上取得 SOTA:标准无偏评测下得分 63%,通过新的 provider adapter harness 达到 99%,并在 96% 的 ARC-AGI-3 关卡上超越人类表现,构建了迄今最精细的新环境符号模型。专为暴露新推理失败而设计的基准,已被最强系统逼近天花板。

更有意思的是评测框架的影响:同一个模型,用 ARC Prize 的 provider-neutral 标准 harness 只有 62.7%,换成 OpenAI 原生的推理状态保存与长上下文管理方式后飙到 99.9%——模型权重没变、环境没变,变的只是评测包装层。"Provider Adapter harness" 即在跑基准时允许模型使用其厂商自建的上下文管理机制。

所属事件:GPT-6 Astra 刷爆 ARC-AGI-3,隐式推理引热议(6 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →