GPT-6 Astra Launches with Strong but Disputed Benchmarks
OpenAI 于 9 月 4 日发布 GPT-6 Astra,官方称其为「世界最聪明、最对齐的模型」,并同步公开系统卡与部署安全评估报告(deploymentsafety.openai.com)。模型宣称在 ARC-AGI-3 上取得 62.7%(约为 Opus 5 的两倍),但发布后围绕跑分口径、综合实力与定价的争议迅速发酵。
已确认
- 定价:输入/输出 $10/$50 每百万 token,为 GPT-5.6-Sol($4/$20)的 2.5 倍;缓存读 9 折、缓存写加价(m13)。
- Artificial Analysis 智能指数显示 Astra(max)与 GPT-5.6-Sol(max)基本持平,综合榜未超过 Fable,也低于 Opus、Fable、Spark(m3、m4、m6、m7)。
- ARC-AGI-3 出现两个官方口径成绩:Standard harness 62.71%(max reasoning),而使用专为该基准定制的 agentic harness(OpenAI responses + 定制工具)时新任务可达 99.9%(m12、m16)。
- UK AISI 独立实测:Astra 任务时间跨度达 30.9 分钟,GPT-5.6 Sol(无 CoT)仅 3.6 分钟(m8)。
- ARC Prize 官方博客称 Astra 在 ARC-AGI-3 上达到饱和,且完成任务的步数少于人类平均(m11)。
- 团队成员 yanndubs 自述:模型更聪明、对齐与 CUA 能力增强(曾用 Blender 建房演示),但代码 slop 较多、确认请求过频(m15)。
- Agentic Index 上 Astra 落后 Fable 10 分、落后 Sol 7 分,与 Terra、Qwen3.8 27B 相当(m9)。
尚未确认
- Reddit 用户(m2)拆解称公平条件下 ARC-AGI-3 仅 54.8%,指 98.6%/99.9% 的口径「技术上真实但刻意误导」;m14 亦有用户质疑成绩是否通过 hacking 基准取得。OpenAI 官方未对此回应。
- m10 有用户指 System Card 用对数坐标作图,淡化 Astra 思维链可控性随 CoT 长度恶化的程度,属个人分析。
- 前 OpenAI/Anthropic 安全研究员 Ryan Greenblatt 警告:据称 Astra 能完全脑内(不出声 CoT)解高难竞赛数学题,「不透明推理」是巨大跳变,CoT 监控或将失效——此为基于传闻能力的风险判断(m20)。
为什么重要
Astra 的发布再次暴露了前沿模型跑分口径的脆弱性:同一基准在不同 harness 下可差出近 40 个百分点,第三方综合指数(AA)与官方宣传形成明显反差。同时其 2.5 倍的涨价、Agentic Index 落后于竞品,以及脑内推理导致 CoT 监控可能失效的安全担忧,都直接影响用户采购决策与前沿模型的安全治理框架。
2026-09-04 ~ 2026-09-04 · 117 related posts
- Episode 1: Leaked Details Emerge on OpenAI's GPT-6 Astra Long-Autonomy Model(2026-09-03, 4 posts)
- Episode 2: GPT-6 Astra Launches with Strong but Disputed Benchmarks(2026-09-04, 117 posts)
- Episode 3: Every's Hands-On with GPT-6 Astra: Best Writing Model Yet, Still Trails Fable(2026-09-04, 15 posts)
- Episode 4: Report: GPT-6 Astra post-training unfinished, compute-to-performance scaling still unstable(2026-09-04, 2 posts)
- Episode 5: Early testers hail GPT-6 Astra as biggest leap yet, with stunning computer-use skills(2026-09-04, 13 posts)
- Episode 6: GPT-6 Astra Sets ECI Record at 169, Sweeping Multiple Benchmarks(2026-09-04, 11 posts)
Primary sources
- GPT-6 Astra is here: evals saturating, more trustworthy — and more code slop — yanndubs · 2026-09-04
- [source] GPT-6 Astra matches Fable 5 on coding at half the cost, but priced 2.5x its predecessor — Polymarket · 2026-09-04
- GPT-6 Astra Priced at $10/$50 per Million Tokens, 2.5x GPT-5.6 Sol — ArtificialAnlys · 2026-09-04
- GPT-6 Astra Cuts Coding Agent Token Use ~3x at Max Effort vs GPT-5.6 Sol — ArtificialAnlys · 2026-09-04
- GPT-6 Astra Sets New Pareto Frontier, Cutting Output Tokens ~10% vs GPT-5.6 Sol — ArtificialAnlys · 2026-09-04
- GPT-6 Astra gains ~80 points on AA-Briefcase but regresses similarly on GDPval-AA v2 — ArtificialAnlys · 2026-09-04
- GPT-6 Astra cuts hallucination rate from 92% to 51%, driving big AA-Omniscience jump — ArtificialAnlys · 2026-09-04
- Artificial Analysis adds GPT-6 Astra comparison against leading models — ArtificialAnlys · 2026-09-04
- GPT-6 Astra shows substantially lower chain-of-thought monitorability — scaling01 · 2026-09-04
- OpenAI's Astra ships: smarter, more aligned, better CUA — but code slop and over-confirmation remain — willdepue · 2026-09-04
- Hands-on with GPT-6 Astra: browser use, hardware hacks and one-shot features in first deep review — lennysan · 2026-09-04
- [source] GPT-6 Astra System Card Released on OpenAI's Deployment Safety Site — itchyfeetleech · 2026-09-04
- Leaked GPT-6 Astra reportedly reverse-engineers 99.2% of binaries — SEO · 2026-09-04
- OpenAI admits GPT-6 Astra is more aligned but less monitorable — gabrielchua · 2026-09-04
- Why does GPT-6 Astra get mogged on the AA index? Caballero asks — ethanCaballero · 2026-09-04
- GPT-6 Astra's AA Intelligence Index and Coding Agent Index Scores Surface — signed7 · 2026-09-04
- Analyst Confirms GPT-6 Astra Reverse-Engineers Binaries Without Source Code — BenBajarin · 2026-09-04
- Astra launches: saturated evals, better alignment, but code slop and over-confirmation remain — ren_hongyu · 2026-09-04
- UK AISI eval: GPT-6 Astra hits 30.9-min no-CoT math time horizon, 8x GPT 5.6 Sol — teortaxesTex · 2026-09-04
- OpenAI Team Member on Astra: Smarter and More Aligned, but Code Slop and Excessive Confirmations Remain — every · 2026-09-04
- Astra update: evals saturating, better CUA, but asks for confirmation too often — himanshustwts · 2026-09-04
- GPT-6 Astra saturates ARC-AGI-3 using fewer moves than average humans — TimeTruth2490 · 2026-09-04
- GPT-6 Astra Early Test: 21B Tokens In, Priced at 2x GPT 5.6 Sol — charliermarsh · 2026-09-04
- OpenAI publishes GPT-6 Astra systems card with safety overview — -ignotus · 2026-09-04
- GPT-6's Artificial Analysis Intelligence Index scores surface in new gallery — ColorLaser · 2026-09-04
- GPT-6 Astra system card: first OpenAI model to hit Critical cybersecurity capability — mallow610 · 2026-09-04
- Astra tops every benchmark but stagnates on Arena, sparking distrust of Artificial Analysis index — brandon_galang · 2026-09-04
- GPT-6 brings big capability jump but lower monitorability, researcher warns of alignment bottleneck — tomekkorbak · 2026-09-04
- UK AISI Tests: Astra Hits 30.9-min No-CoT Math Horizon, 10x GPT-5.6 Sol — haider1 · 2026-09-04
- Watch GPT-6 Astra one-shot Minority Report-style control of a computer in 41 seconds — craigsdennis · 2026-09-04
- GPT-6 Astra loses to fable 5.1 and opus 5 on key benchmarks, priced at $50 per 1M output tokens — ns123abc · 2026-09-04
- GPT-6 Astra barely improves over 5.6 Sol on Artificial Analysis Intelligence Index — burny_tech · 2026-09-04
- Zvi warns Astra's CoT controllability surge could systematically erode AI monitorability — TheZvi · 2026-09-04
- UK AISI assessment: Astra reasons in a more compressed style than GPT 5.6 Sol — maksym_andr · 2026-09-04
- Screenshot Shows GPT-6 Astra Does Not Beat Fable on Artificial Analysis Index — Blackham · 2026-09-04
- OpenAI researcher: GPT-6 better aligned but less monitorable, first to evade CoT-only monitors — burny_tech · 2026-09-04
- GPT-6 Astra early access: dev builds 95% of a flight sim in a single request — Dimillian · 2026-09-04
- GPT-6 Astra reportedly smashes automation bench record at 41.4%, up from 31.4% — sandersted · 2026-09-04
- Astra system card: improved CoT controllability and no-CoT strength with fewer tokens — SeunghyunSEO7 · 2026-09-04
- Astra model card: 61% CoT self-control, evades sandbagging monitor, drops recall to 11% — morqon · 2026-09-04
- Observation: new model's CoT controllability improves with longer RL training — SeunghyunSEO7 · 2026-09-04
- Did GPT-6 Astra hack its way to a massive ARC-AGI-3 score jump? — jayokunle · 2026-09-04
8 near-duplicate retellings: yanndubs · ArtificialAnlys · ArtificialAnlys · ArtificialAnlys · ronbodkin · deanwball · SeunghyunSEO7 · maksym_andr