Astra 榜单 97.6% 独立测试仅 61 分,价格翻倍换持平智能
eyishazyer · x · 2026-09-04
作者逐项拆解了 Astra 发布会的亮眼数字与独立评测之间的落差:
- 官方成绩确实亮眼:FrontierMath Tier 4 达 97.6%,GPQA Diamond 96.0%,ExploitBench 100%。
- 但独立评测打平了:Artificial Analysis 的 Intelligence Index 里 Astra 得 61 分,与它刚取代的 Sol 持平,还落后于 Fable 5.1(66)和 Muse Spark 1.3。
- 评测口径问题:Astra 官方宣传的 ARC-AGI-3 99.9% 来自一个耗资 1.9 万美元的定制 harness;用默认 harness 跑同一模型,得分掉到 62.7%,成本还更高。
- 定价:输入 $10/百万 token、输出 $50,是 Sol 的 2.5 倍,与 Fable 5.1 持平——智能分数相同却要付两倍多价钱。
- 真实进步:token 效率提升对 agent 场景确有价值;网络安全能力成为首个跨过 OpenAI Critical 阈值的模型。
作者最后点出最值得玩味的时间线:Brockman 台上宣称 "welcome to the AGI era",被追问技术细节时又改口称 "mission concept",而独立评测数据在几小时后就落地了。
所属事件:GPT-6 Astra评测汇总:能力提升但官方数据遭质疑(3 条相关)→
「模型」频道最新
- Paul Graham:初创公司转向开源权重模型已是真实趋势 — ycombinator · 2026-09-04
- 曝 AI Analysis 基准或偏向 OpenAI:GPT-6 Astra 疑落后 Fable 与 Opus — Shubham_Garg123 · 2026-09-04
- Gemini Live 实际通话音质遭吐槽:选音色是 HD,用起来像 64k 电话 — Dry_Spite_4784 · 2026-09-04
- LangSmith 数据:gpt-4o-mini 触达率 13%,开源模型仅 DeepSeek V4 Flash 上榜 — LangChain · 2026-09-04
- Matt Wolfe 周报:GPT-6 Astra、Claude Fable、NVIDIA 收购 Hugging Face — Matt Wolfe · 2026-09-04
- Polymarket 押注月底前发布新 Claude Opus 概率达 60% — Polymarket · 2026-09-04