GPT-6 Astra 登顶 ARC-AGI:标准测试 62.7%,新框架下达 99.9%
BlackHC · x · 2026-09-04
OpenAI 的 GPT-6 Astra 在 ARC Prize 团队的分析中刷新 ARC-AGI 系列纪录:
- ARC-AGI-3:在标准测试框架(允许模型跨题携带笔记、用于历史同口径对比)下得分 62.7%,比此前验证最高分翻倍还多;超过 96% 关卡的人类表现
- 新 provider adapter 框架:保留模型不透明推理状态、随上下文增长使用原生压缩,Astra 在 ARC-AGI-3 上得分高达 99.9%,ARC Prize 称其构建了迄今最精准的新环境符号模型
- ARC-AGI-2:新 SOTA 95.0%;ARC-AGI-1 与 Fable 5 并列 98.5%
- 标准框架下还首次出现成本/性能曲线反向弯曲,最高单次运行成本约 2.6 万美元
ARC Prize 表示今后将同时用标准框架与 provider adapter 框架评测模型。
所属事件:GPT-6 Astra 登顶 ARC-AGI:标准测试 62.7%,新框架近满分(2 条相关)→
「模型」频道最新
- OpenAI 为 GPT-6 Astra 上线失准监控,官方承认监测或有遗漏 — ShakeelHashim · 2026-09-04
- Databricks 评测:GPT-6 Astra 登顶 OfficeQA Pro 数据推理新 SOTA — downingARK · 2026-09-04
- 数学家实测 GPT-6 Astra:边写论证边在 Lean 里实时验证证明 — teortaxesTex · 2026-09-04
- Tavus 发布 Sparrow-2:主打轮次检测与打断处理的对话理解模型 — ycombinator · 2026-09-04
- ARC-AGI-3 实测:max 推理多花 10 倍 token,总成本反降三成 — i_dg23 · 2026-09-04
- 研究者指 OpenAI Astra 系统卡存在数学基准数据污染疑点 — dfrsrchtwts · 2026-09-04