专题 · FULL STORY

GPT-6 Astra:从爆料到发布的两天

9月3日内部测试者率先爆料 Astra 双检查点及长时自主任务方向,次日 OpenAI 正式发布 GPT-6 Astra,跑分多项刷新纪录,官方随即定调其为迄今最对齐、计算机使用与软件工程最强的模型。

2026-09-03 ~ 2026-09-04 · 3 集 · 46 条

第 1 集 · 爆料称 Astra 双版本测试中主打长时自主任务(2026-09-03,3 条)

内部测试者 Lentils80 披露,OpenAI 的两个 GPT Astra 检查点 "ultima-alpha" 和 "vega-alpha" 正在测试,前者疑似面向公众发布。另有用户称 Astra 是首个让他觉得「不再是更好的 ChatGPT」的模型,据称包含 10 项研究级数学/CS 进展,并突破了 OpenAI 内部研究基准,因而被称为「分水岭模型」。

第 2 集 · GPT-6 Astra 发布跑分曝光:ARC-AGI-3 达 98.6%(2026-09-04,41 条)

OpenAI 于 09-04 发布 GPT-6,代号 Astra,基准测试成绩随发布同步流出,多项指标大幅刷新纪录。据称这是 OpenAI 迄今规模最大的训练运行,也是首个在 Stargate 基础设施上用超过 10 万 DBU 预训练的模型。

已确认

  • 多条帖子一致转述的基准成绩:ARC-AGI-3 从 7.8% 升至 98.6%,FrontierMath Tier 4 v2 达 97.6%,DeepSWE v1.1 达 74.1%,BenchCAD 95.9%,GPQA Diamond 96%,ExploitBench 满分,在展示的所有测试中全面超过 GPT-5.6 Sol(m4、m5、m11、m14 等)
  • 官方博客口径:AAII 得分 61.2,略高于 GPT-5.6 Sol;Coding Agent Index 得 67,略落后于 Fable 5(m6、m17)
  • 训练细节:研究员 Aidan Clark 称这是 OpenAI「迄今规模最大的训练运行」,首个在 Stargate 基础设施上以超 10 万 DBU 预训练的模型,且首次由前代模型主要参与监督下一代模型的训练(m10、m15、m20)

尚未确认

  • 多数成绩以截图形式流传,部分帖子(m8、m13)明确标注未经官方证实,个别帖子提醒发布前跑分爆料常有夸大或伪造;FrontierMath Tier 4 得分在不同帖子中分别出现 97.6% 与 97.4% 两种说法,具体数值有待官方口径确认

为什么重要

  • ARC-AGI-3 从 7.8% 跃升至 98.6% 的幅度极为罕见,randlongevity 表示完全没预测到该分数能这么高,认为这印证了「我们正活在奇点里」(m19)
  • bindureddy 实测后给出更细的判断:Astra 在推理、数学、数据分析和研究能力上确实胜过 Fable 5.1,但 Fable 5.1 仍是编程之王(m12),与官方编码指数略逊 Fable 5 的数据互相印证
  • teortaxesTex 借此感叹模型迭代节奏过快:GPT-5.6 Sol 发布不到两个月即被超越,「享乐跑步机」已达峰值,刚发布就过时(m7)

还有 21 条相关讨论 →

第 3 集 · OpenAI 定调 Astra:最对齐模型,计算机使用与软件工程最强(2026-09-04,2 条)

OpenAI 官方在 GPT-6 Astra 发布后密集定调:称 Astra 是其迄今为止最对齐的模型,在理解用户意图方面有实质性改进;开发者账号还表示 Astra 是迄今在计算机使用、软件工程和视觉理解方面最好的模型,并分享了多位一线开发者的使用感受,强化其全能旗舰定位。