OpenAI 发布 GPT-6 Astra:ARC-AGI-3 得 99.9%,但独立评测泼冷水
Latent Space · rss · 2026-09-04
- 发布概况:OpenAI 推出旗舰模型 GPT-6 Astra,定位为“最智能、对齐最好的模型”,主打计算机操作、软件工程、数学/科学、办公文档与网络安全。发布 9 小时内获 3600 万浏览、16.4 万点赞,首发面向少数机构,随后几天覆盖 Plus/Pro/Business/Enterprise、API 与 AWS。
- 定价与功能:标准版 $10/$50 每百万输入/输出 token,快速版 $20/$100(提速至 2.5 倍)。同步推出 Codex 提问不中断、实验性长期任务笔记与上下文搜索、Responses API 异步调用与中途转向等特性。
- 官方成绩:ARC-AGI-3 达 99.9%、FrontierMath Tier 4 98%、ExploitBench 100%,称已协助解决数学长期开放问题(如素数间隙)。
- 独立评测存疑:Artificial Analysis 给出混合结论——编码智能体指数 67(与 Claude Opus 5 持平,低于 Fable 5.1 的 70),智能指数 61 落后 Fable 5.1 五分;token 效率大幅提升但单价高,max 档每任务成本比上代贵约 75%;幻觉率从 92% 降至 51%,但 GDPval、SciCode 等多项基准出现回退。
- ARC 侧:Chollet 确认标准 harness 下 63-66%、特殊 harness 下近 100%,单局成本约 $360,模型展现即时符号世界建模与涌现 DSL;ARC-AGI-3 饱和速度比预期快约一倍,ARC-AGI-4 将于 2027 Q1 推出。
- 安全争议:系统卡披露对齐改进的同时思维链可监控性下降,引发 Neel Nanda、Ryan Greenblatt 等研究者对评估意识与发布治理的批评。发布过程亦因延迟、博客故障和付费用户晚于网红获得访问权而受挫,OpenAI 以每日补偿性额度重置回应。
「模型」频道最新
- Astra 纯电脑操作跑 Excel 世界锦标赛题,比人类冠军快约 4 倍 — sandersted · 2026-09-04
- 研究者断言:harness 和 MCP 终将被训练进模型,唯一壁垒是数据 — A_K_Nain · 2026-09-04
- Polymarket 开盘竞猜 Grok 4.7+ 发布时间,市场押注最早 9 月中旬 — Polymarket · 2026-09-04
- 前 GDM 研究员 denny_zhou 披露已转投 Meta,参与 Muse Spark 1.1 至 1.3 — infoxiao · 2026-09-04
- 「真正的 AGI 基准」:模型至今做不了数据科学 — max_paperclips · 2026-09-04
- 恶搞「GPT-6 发布」:称生命科学与药物研发仍是 AI 最难领域 — gklambauer · 2026-09-04