GPT-6 Astra 早期评测:推理破纪录、速度大增,但基准口径与实际落差引争议
OpenAI 未正式发布的新旗舰模型 GPT-6 Astra 迎来一轮密集的早期评测与社区讨论,核心图景是:基准成绩亮眼且推理性价比大幅提升,但官方数字与独立测试之间存在明显落差,多位评测者更倾向于把它看作计算机使用/agent 专用模型而非 AGI。
已确认
- ARC-AGI 方面:ARC Prize 团队成员 mhmazur 发长文称,Astra 在标准 harness 下得分 62.7%,刷新纪录;在新架构下达 99.9%(m11)。ARC Prize 官方博客还指出 Astra 在 ARC-AGI-3 拿到 99.9% 的成本比一个月前 Opus 5 只做到 30% 时还低(m14)。Reddit 用户 DeArgonaut 汇总了 Astra 在 ARC-AGI-1/2/3 三代基准上的全部官方成绩与成本档位(m8)。
- 实测对比:Bindu Reddy 的实测认为 Astra 表现出色但仍略逊于 Fable 5.1,短板在长时间运行的 agentic 循环,长项在浏览器操作和 3D 渲染,同时价格便宜得多、速度快得多(m4、m6)。tristanbob 也确认 Astra 明显快于 Fable,不确定是 token 速率还是 token 效率提升,戏称其为「Fastra」(m12)。
- 官方发布会数字包括 FrontierMath Tier 4 达 97.6%、GPQA Diamond 96.0%、ExploitBench 100%(m16)。
- 其他评测观点:petergostev 长篇实测称 Astra 智能水平大幅提升,一个案例中 SQL 代码从 3.3 万行瘦身到 1800 行(m5、m10);MoonL88537 的初印象是比 Fable 更聪明、判断更稳,在 Sol 和 Fable 会出错的调用上能瞬间做出无瑕疵判断(m13)。潜空间的汇总评论指出 Astra 的 Coding Agent 能力与 Claude Opus 5、Fable 5 相当,落后于 Fable,单任务成本减半,但思维链监控失效(m15)。
尚未确认
- Artificial Analysis 基准的中立性遭 ShubhamGarg123 质疑:其称 Astra 实际可能落后于 Fable 甚至 Anthropic 的 Opus,而该机构自称独立却被数百万人引用(m1)。
- Simon Smith 指出反常现象:Astra 在 Epoch ECI 上刷新纪录,却在 Artificial Analysis Intelligence Index 上与 GPT-5.6 Sol 持平,网友质疑两者口径(m7)。
- eyishazyer 拆解官方与独立评测的落差,称榜单 97.6% 对应的独立测试仅 61 分,价格翻倍只换来持平的智能水平(m16)。
- VraserX 的推文称 Astra 在场景生成 demo 中明显胜过 Fable 5.1 并宣称其已是 AGI,属单方面热情评价,无系统性评测数据(m9)。
为什么重要
- Astra 展示了在抽象推理基准上性价比的代际跃升(更低成本达到更高分),若独立复现成立,将影响对前沿模型能力边界的判断。
- 官方数字与独立评测的系统性落差,以及第三方基准机构被质疑偏向,凸显当前模型评测生态的口径混乱,用户需谨慎看待发布会数字。
- 多位评测者(becomingengageably 等)的共识方向是:与其争论 Astra 是否 AGI,不如关注它在浏览器操作、长程 agent 循环等实际工作流中的表现,这为评估新一代模型提供了更务实的框架。
2026-09-04 ~ 2026-09-05 · 16 条相关
一手来源
- GPT-6 Astra 刷新 ARC-AGI 纪录:标准测试 62.7%,新架构下达 99.9% — repligate ·
- 实测称 GPT-6 Astra 略逊 Fable 5.1,但更便宜更快 — bindureddy ·
- Astra 榜单 97.6% 独立测试仅 61 分,价格翻倍换持平智能 — eyishazyer ·
- GPT-6 Astra 三代 ARC-AGI 成绩全公开,附各成本档位对比 — DeArgonaut · 2026-09-04
- GPT-6 Astra 在 ARC-AGI-3 拿 99.9%,成本远低于上月 Opus 5 的 30% — 233C · 2026-09-04
- GPT-6 Astra 评测汇总:单任务成本减半,但思维链监控失效 — vista8 · 2026-09-04
- 【源头】GPT-6 Astra 刷新 ARC-AGI 纪录:标准测试 62.7%,新架构下达 99.9% — repligate · 2026-09-04
- 【源头】Astra 榜单 97.6% 独立测试仅 61 分,价格翻倍换持平智能 — eyishazyer · 2026-09-04
- GPT-6-Astra 实测:智能水平大幅提升,SQL 代码从 3.3 万行瘦身到 1800 行 — i_dg23 · 2026-09-04
- GPT-6 Astra 创 Epoch ECI 纪录却在 AA 指数持平 GPT-5.6,网友质疑口径 — scaling01 · 2026-09-04
- GPT-6 Astra 演示碾压 Fable 5.1,发帖人称差距明显 — VraserX · 2026-09-04
- 曝 AI Analysis 基准或偏向 OpenAI:GPT-6 Astra 疑落后 Fable 与 Opus — Shubham_Garg123 · 2026-09-04
- GPT-6 Astra 评测分化:更像计算机使用专用模型而非 AGI — becomingengageably · 2026-09-04
- 评测者盛赞 OpenAI GPT-6-Astra:会猜到你想要什么,能力直逼 Fable — pvncher · 2026-09-05
- 【源头】实测称 GPT-6 Astra 略逊 Fable 5.1,但更便宜更快 — bindureddy · 2026-09-05
- 实测:GPT-6 Astra 比 Fable 5.1 便宜快得多,长任务略逊 — bindureddy · 2026-09-05
- 用户实测 GPT-6 Astra 初印象:比 Fable 更聪明、判断更稳 — MoonL88537 · 2026-09-05
- 用户实测 OpenAI 新模型 Astra:速度明显快于前代 Fable — tristanbob · 2026-09-05
另有 1 条近重复转述:becomingengageably