专题 · FULL STORY
GPT-6 Astra:从爆料到发布的两天
9月3日内部测试者率先爆料 Astra 双检查点及长时自主任务方向,次日 OpenAI 正式发布 GPT-6 Astra,跑分多项刷新纪录,官方随即定调其为迄今最对齐、计算机使用与软件工程最强的模型。
2026-09-03 ~ 2026-09-04 · 3 集 · 46 条
第 1 集 · 爆料称 Astra 双版本测试中主打长时自主任务(2026-09-03,3 条)
内部测试者 Lentils80 披露,OpenAI 的两个 GPT Astra 检查点 "ultima-alpha" 和 "vega-alpha" 正在测试,前者疑似面向公众发布。另有用户称 Astra 是首个让他觉得「不再是更好的 ChatGPT」的模型,据称包含 10 项研究级数学/CS 进展,并突破了 OpenAI 内部研究基准,因而被称为「分水岭模型」。
- Astra 被称「分水岭模型」:据称突破 OAI 内部研究基准 — haider1 · 2026-09-03
- 爆料称 OpenAI Astra 有两个测试版,主打长时自主任务 — Ok_Display_3159 · 2026-09-03
- GPT-6 Astra 跑 PostTrainBench Lite,作者称表现惊人 — maksym_andr · 2026-09-04
第 2 集 · GPT-6 Astra 发布跑分曝光:ARC-AGI-3 达 98.6%(2026-09-04,41 条)
OpenAI 于 09-04 发布 GPT-6,代号 Astra,基准测试成绩随发布同步流出,多项指标大幅刷新纪录。据称这是 OpenAI 迄今规模最大的训练运行,也是首个在 Stargate 基础设施上用超过 10 万 DBU 预训练的模型。
已确认
- 多条帖子一致转述的基准成绩:ARC-AGI-3 从 7.8% 升至 98.6%,FrontierMath Tier 4 v2 达 97.6%,DeepSWE v1.1 达 74.1%,BenchCAD 95.9%,GPQA Diamond 96%,ExploitBench 满分,在展示的所有测试中全面超过 GPT-5.6 Sol(m4、m5、m11、m14 等)
- 官方博客口径:AAII 得分 61.2,略高于 GPT-5.6 Sol;Coding Agent Index 得 67,略落后于 Fable 5(m6、m17)
- 训练细节:研究员 Aidan Clark 称这是 OpenAI「迄今规模最大的训练运行」,首个在 Stargate 基础设施上以超 10 万 DBU 预训练的模型,且首次由前代模型主要参与监督下一代模型的训练(m10、m15、m20)
尚未确认
- 多数成绩以截图形式流传,部分帖子(m8、m13)明确标注未经官方证实,个别帖子提醒发布前跑分爆料常有夸大或伪造;FrontierMath Tier 4 得分在不同帖子中分别出现 97.6% 与 97.4% 两种说法,具体数值有待官方口径确认
为什么重要
- ARC-AGI-3 从 7.8% 跃升至 98.6% 的幅度极为罕见,randlongevity 表示完全没预测到该分数能这么高,认为这印证了「我们正活在奇点里」(m19)
- bindureddy 实测后给出更细的判断:Astra 在推理、数学、数据分析和研究能力上确实胜过 Fable 5.1,但 Fable 5.1 仍是编程之王(m12),与官方编码指数略逊 Fable 5 的数据互相印证
- teortaxesTex 借此感叹模型迭代节奏过快:GPT-5.6 Sol 发布不到两个月即被超越,「享乐跑步机」已达峰值,刚发布就过时(m7)
- 曝 OpenAI Astra 用超 10 万 GPU 于德州 Stargate 完成史上最大训练 — cedric_chee · 2026-09-04
- GPT-6 Astra 跑分出炉,基准测试成绩解析 — CounterReady4774 · 2026-09-04
- GPT-6 Astra 基准测试成绩流出 — james_6732 · 2026-09-04
- 曝 GPT-6-Astra 跑分流出:ARC-AGI-3 达 98.6% — scaling01 · 2026-09-04
- GPT-6 Astra 疑似跑分截图流出,尚未获官方证实 — haider1 · 2026-09-04
- GPT-6 Astra Tier 4 数学拿 97.4%,10 万卡史上最大训练 — ChrisGPT · 2026-09-04
- 未证实:GPT-6 Astra 评测跑分流出,OpenAI 宣称进入「AGI 时代」 — mark_k · 2026-09-04
- GPT-6 Astra 编程成绩仅较上代提升约 6%,改善不及外界预期 — robleclerc · 2026-09-04
- GPT-6 Astra 跑分碾压 Fable 5.1:Terminal Science 与 Automation Bench 双领先 — ChrisGPT · 2026-09-04
- 传 OpenAI 新模型 Astra 刷出 ARC-AGI-3 98.6%,成绩惊人但未证实 — teortaxesTex · 2026-09-04
- GPT-6 Astra 完整跑分曝光:ARC-AGI-3 从 7.8% 飙至 98.6% — kimmonismus · 2026-09-04
- ARC-AGI-3 被 GPT-6 冲到 98.6%,提前兑现饱和预言 — burny_tech · 2026-09-04
- GPT-6-Astra 跑分曝光:ARC-AGI-3 达 98.6%,ExploitBench 满分 — teropa · 2026-09-04
- 曝 GPT-6 Astra 在 ARC-AGI-3 上拿下 98.6%,远超预期 — burny_tech · 2026-09-04
- 业内震惊:Astra 的 ARC 成绩被称或代表真正跃迁 — salahuddin · 2026-09-04
- 曝 GPT-6 Astra 跑分:ARC-AGI-3 达 98.6%,全面超越 GPT-5.6 — iamaliveix · 2026-09-04
- Astra 上线,基准成绩同步公开 — Hyleal · 2026-09-04
- GPT-6 Astra 跑分曝光:ARC-AGI-3 拿下 98.6% — Dr_Singularity · 2026-09-04
- GPT-6 训练细节再曝光:前代模型监督下一代训练 — Dr_Singularity · 2026-09-04
- 实测称 GPT-6 Astra 推理数学碾压 Fable 5.1,编程仍输 — bindureddy · 2026-09-04
第 3 集 · OpenAI 定调 Astra:最对齐模型,计算机使用与软件工程最强(2026-09-04,2 条)
OpenAI 官方在 GPT-6 Astra 发布后密集定调:称 Astra 是其迄今为止最对齐的模型,在理解用户意图方面有实质性改进;开发者账号还表示 Astra 是迄今在计算机使用、软件工程和视觉理解方面最好的模型,并分享了多位一线开发者的使用感受,强化其全能旗舰定位。
- OpenAI 称 GPT-6 Astra 是其最对齐模型,意图理解大幅改进 — OpenAI · 2026-09-04
- OpenAI 定调:Astra 是计算机使用与软件工程最强模型 — dkundel · 2026-09-04