GPT-6 Astra 多榜刷新纪录:更强且更省 token
GPT-6 Astra 于 9 月 5 日前后向部分用户开放后,在多个第三方基准上刷新纪录,核心叙事是「更强且更省 token」:Artificial Analysis 更新榜单显示其跑分超越 GPT-5.6 Sol,并在 Intelligence Index 与每任务输出 token 数上定义新的帕累托前沿,最大推理档下输出 token 比 Sol 减少约 10%;NYT Connections(Extended)基准上 xhigh 档拿到创纪录的 98.1 分、high 档 97.7 分,均超过上代且单题成本约低 40%;Terminal Bench 4.0 上使用 Codex harness 排名第一,成本仅为第二名方案的一半、较此前方案低约 47%。这波「性能更强、成本更低」的表现引发社区广泛讨论。
已确认
- Artificial Analysis 榜单:GPT-6 Astra 跑分超越 GPT-5.6 Sol,并在智能指数与输出 token 数上定义新帕累托前沿(m2、m19)
- NYT Connections 基准:xhigh 档 98.1 分、high 档 97.7 分,超越 GPT-5.6 Sol,每题成本约低 40%(m4、m18)
- Terminal Bench 4.0:排名第一,成本约为第二名一半、较此前低约 47%(m7、m17)
- 视觉基准 eyebench-v3:Astra-max 得 95%,输出 token 约为 Sol-max 的 1/3.8,成本仅一半,得分接近两倍;博主 adonissingh 称按「每 token 智力」衡量即使低推理档也大幅领先(m12、m15、m16)
- MineBench.ai 团队称 Astra 首次生成质量远超当前排行榜前四模型,是该基准上线以来质量跃升最显著的一次(m3)
- 实测体验:博主 kimmonismus 称 Astra-Medium 档智能水平与 GPT-5.6 xhigh 大致相当但成本约 1/3;Reddit 用户 dubesor 在 iOS 端实测认为其视觉杂志排版优于 GPT-5.6 Sol;Angaisb 在 Max 推理档对比后表示满意;Simon Willison 用「画鹈鹕」SVG 任务对比 GPT-5.6 系 Sol、Terra、Luna,单次最贵 63 美分(m5、m6、m8、m9、m11)
- API 定价:Astra 输入 $10、输出 $50 / 1M tokens,约为 GPT-5.6 Sol($4 / $20)的 2.5 倍溢价(m14)
尚未确认
- FrontierMath T4 榜单称 Astra 得分高于 5.6 Sol Pro (Max),为爆料转述,未见官方数据;评论者 teortaxesTex 认为开源模型 18 个月内难达这一水平,属个人观点(m10)
- 开发者 xeophon 的初步体验认为整体是渐进式改良而非质变:代码质量与之前大致相同、仍需人工引导,大规模数据分析处于同一水平,仅代表个体体验(m13)
- 多数基准数据来自社区与第三方维护榜单,OpenAI 官方尚未系统确认(m2、m3、m12)
为什么重要
- token 效率被视为 Astra 未被充分讨论的胜负手:Reddit 用户 Cagnazzo82 分析称,同等任务花费更少 token,若与速度、质量叠加,等于直接打向竞争对手的成本软肋(m1)
- DataLearnerAI 指出 2.5 倍的 API 溢价并未换来同幅度推理能力提升,提升更多集中在 Agent 任务而非推理,「高溢价」与「省 token」两种叙事并存,实际成本取决于使用场景(m14)
- 若「每 token 智力」优势属实,将重塑模型性价比评估标准,对竞争对手的定价与产品策略构成压力
2026-09-05 ~ 2026-09-06 · 19 条相关
- 第 1 集:GPT-6 Astra 3D 建模实测刷屏,社区直呼 SOTA(2026-09-04,37 条)
- 第 2 集:传 GPT-6 Astra 可直接 3D 建模,OpenAI 未证实(2026-09-04,2 条)
- 第 3 集:OpenAI 发布 GPT-6 Astra 并宣告 AGI 时代(2026-09-04,21 条)
- 第 4 集:GPT-6 Astra 多榜刷新纪录:更强且更省 token(2026-09-05,19 条)
- 第 5 集:开发者称 GPT-6 Astra 五分钟找出176倍代码提速(2026-09-05,2 条)
- 第 6 集:GPT-6 Astra 发布刷屏:用例井喷与演示争议并存(2026-09-05,9 条)
- 第 7 集:曝 OpenAI Astra 训练动用超 10 万枚 GPU(2026-09-05,2 条)
- 第 8 集:GPT-6 Astra 机器人控制得分 95%,成本仅前代 43%(2026-09-05,6 条)
- 第 9 集:传 OpenAI GPT-6 Astra 视觉能力碾压 Gemini(2026-09-05,3 条)
- 第 10 集:OpenAI 发起 GPT-6 Astra 24 小时出货挑战(2026-09-05,4 条)
- 第 11 集:GPT-6-Astra 登顶 MathArena 数学基准(2026-09-06,2 条)
- 第 12 集:GPT-6 Astra 登顶 Code Arena WebDev 榜 领先 Claude 35 分(2026-09-06,4 条)
- 第 13 集:传闻中的 GPT-6 Astra 基准数据曝光(2026-09-06,2 条)
- 第 14 集:GPT-6 Astra 两小时自主重建玛雅遗址 3D 模型(2026-09-06,3 条)
- 第 15 集:开发者实测称 OpenAI Astra 是唯一能推进超复杂项目的模型(2026-09-06,2 条)
- 第 16 集:网传 GPT-6 Astra 自主通关 Portal,真实性存疑(2026-09-06,5 条)
- 第 17 集:GPT-6 Astra 饱和空间推理基准,VLM 视觉获突破(2026-09-06,4 条)
一手来源
- Artificial Analysis 新榜:GPT-6-Astra 跑分超越 GPT-5.6-Sol — DaserTheLaser ·
- Astra-max 视觉基准 eyebench-v3 得分 95%,成本仅 Sol-max 一半 — adonis_singh ·
- GPT-6 Astra 在 Terminal Bench 4.0 上便宜约 47% — sherwinwu ·
- 曝 GPT-6 Astra 数学评测超闭源对手,爆料人称开源模型 18 个月内难企及 — inductionheads · 2026-09-05
- Artificial Analysis:GPT-6 Astra 输出 token 较 GPT-5.6 Sol 再省约 10% — peterjliu · 2026-09-05
- GPT-6 Astra 登顶 NYT Connections 基准:98.1 分且成本低四成 — zero0_one1 · 2026-09-05
- 网友实测对比 GPT-6 Astra 与 GPT-5.6 Sol 推理表现 — Angaisb_ · 2026-09-05
- GPT-6 Astra 的隐藏杀招:token 效率或是竞争胜负手 — Cagnazzo82 · 2026-09-05
- GPT-6 Astra 登顶 Terminal Bench 4.0,成本仅为第二名一半 — charliermarsh · 2026-09-05
- MineBench:GPT-6 Astra 首次生成质量远超现役四大模型 — Ballist1cGamer · 2026-09-05
- GPT-6 Astra 做视觉杂志排版实测:比 GPT-5.6 Sol 更出彩 — dubesor · 2026-09-05
- Simonw 实测 GPT-6 Astra 与 5.6 全系 SVG 对比:单次最贵 63 美分 — gaganghotra_ · 2026-09-05
- 实测称 GPT-6 Astra 成本效率惊人:同智能水平价格约为 GPT-5.6 xhigh 三分之一 — charliermarsh · 2026-09-05
- 【源头】GPT-6 Astra 在 Terminal Bench 4.0 上便宜约 47% — sherwinwu · 2026-09-05
- 【源头】Astra-max 视觉基准 eyebench-v3 得分 95%,成本仅 Sol-max 一半 — adonis_singh · 2026-09-05
- 博主感叹 Astra-max 视觉成绩「不公平」,成本减半得分翻倍 — adonis_singh · 2026-09-05
- Astra-max 按「每 token 智力」衡量,低推理档也远超其他模型 — adonis_singh · 2026-09-05
- 【源头】Artificial Analysis 新榜:GPT-6-Astra 跑分超越 GPT-5.6-Sol — DaserTheLaser · 2026-09-05
- GPT-6 Astra 贵 2.5 倍,提升集中在 Agent 而非推理能力 — DataLearnerAI · 2026-09-06
- 开发者实测 GPT-6 Astra:代码质量与数据分析仅小幅提升 — xeophon · 2026-09-06