GPT-6 Astra 刷爆 ARC-AGI-3:换评测框架从 62.7% 跳到 99.9%
rohanpaul_ai · x · 2026-09-05
ARC Prize 官方宣布 OpenAI 的 GPT-6 Astra 在 ARC-AGI 上取得 SOTA:标准无偏评测下得分 63%,通过新的 provider adapter harness 达到 99%,并在 96% 的 ARC-AGI-3 关卡上超越人类表现,构建了迄今最精细的新环境符号模型。专为暴露新推理失败而设计的基准,已被最强系统逼近天花板。
更有意思的是评测框架的影响:同一个模型,用 ARC Prize 的 provider-neutral 标准 harness 只有 62.7%,换成 OpenAI 原生的推理状态保存与长上下文管理方式后飙到 99.9%——模型权重没变、环境没变,变的只是评测包装层。"Provider Adapter harness" 即在跑基准时允许模型使用其厂商自建的上下文管理机制。
所属事件:GPT-6 Astra 刷爆 ARC-AGI-3,隐式推理引热议(6 条相关)→
「模型」频道最新
- 用 Astra 后 ChatGPT 图像生成明显变强 — joshua_saxe · 2026-09-05
- Fable 5.1 对比 GPT 6 Astra 生成 3D Blender 资产,差距惊人 — curious_capsuleer · 2026-09-05
- 爆料称 GPT 6 Astra 一条提示词完美复刻《宝可梦》 — IanArawjo · 2026-09-05
- 用户弃 Gemini 回归 GPT:10 次生成 PDF 9 次被拒,用量消耗还更高 — DrlNoV · 2026-09-05
- GPT-6 Astra 推出实验性压缩机制:跨上下文窗口存笔记可检索 — TheMoonMidas · 2026-09-05
- 同一提示词喂给 Opus 4.8、Fable 5.1 与 GPT 6 Astra,结果对比 — LightningMcLovin · 2026-09-05