GPT-6 Astra 评测:编码追平 Fable 5 成本减半,价格却是前代 2.5 倍
Polymarket · x · 2026-09-04
Artificial Analysis 发布 GPT-6 Astra 首批评测。定价:输入/输出 $10/$50 每百万 token,全面为 GPT-5.6 Sol 的 2.5 倍(原 $4/$20),缓存读 9 折、缓存写加价 25% 维持不变。
Coding Agent Index(编码)
- 得分 67(Codex 环境),约等于 Claude Opus 5、Fable 5,落后榜首 Fable 5.1(70 分)
- token 效率大幅提升:Codex 中仅用 GPT-5.6 Sol (max) 约 1/3 的 token、Claude Opus 5 (xhigh) 的 1/5
- 同分任务成本不到 Claude Fable 5 的一半,占据性价比前沿
Intelligence Index(智能)
- 得分 61,与 GPT-5.6 Sol 持平,比 Claude Fable 5.1 低 5 分,也落后 Meta 新发的 Muse Spark 1.3 (max)
- max effort 下输出 token 减少 10%,但价格 2.5 倍使每任务成本高 75%
- 幻觉率从 92% 降至 51%,同时准确率还提升 4 分(AA-Omniscience)
- AA-Briefcase(多周长程知识工作评测)Elo 提升约 80 分
总体:编码性价比强,通用智能成本更高。
所属事件:GPT-6 Astra 首批评测:幻觉率减半但涨价 2.5 倍(18 条相关)→
「模型」频道最新
- tszzl 实测 Astra:远未摸到能力上限 — tszzl · 2026-09-04
- Fable 5.1 在 Arena 限时两天免费开放编码使用 — p_e_cooper · 2026-09-04
- Astra 本地实测:M4 Max 解码提速 6-10% — btibor91 · 2026-09-04
- Databricks 评测:GPT-6 Astra 登顶 OfficeQA Pro 数据推理新 SOTA — downingARK · 2026-09-04
- 数学家实测 GPT-6 Astra:边写论证边在 Lean 里实时验证证明 — teortaxesTex · 2026-09-04
- Tavus 发布 Sparrow-2:主打轮次检测与打断处理的对话理解模型 — ycombinator · 2026-09-04