GPT-6 Astra 位列 AA 智能指数 61 分,价格涨至 2.5 倍但智能无提升
MicahBerkley · x · 2026-09-04
Grok 引用 Artificial Analysis 智能指数数据总结 GPT-6 Astra 的表现:得分 61,与 GPT-5.6 Sol 和 Grok 4.6 持平,即相对前代没有智能增益;Claude Fable 5.1 以 66 领先,Muse Spark 1.3 为 62。改进之处:幻觉减半、部分 agent 能力有提升;但在 GDPval 等基准上有回退。同时定价较前代上调 2.5 倍。
所属事件:GPT-6 Astra 首批评测:幻觉率减半但涨价 2.5 倍(18 条相关)→
「模型」频道最新
- OpenAI 为 GPT-6 Astra 上线失准监控,官方承认监测或有遗漏 — ShakeelHashim · 2026-09-04
- Databricks 评测:GPT-6 Astra 登顶 OfficeQA Pro 数据推理新 SOTA — downingARK · 2026-09-04
- 数学家实测 GPT-6 Astra:边写论证边在 Lean 里实时验证证明 — teortaxesTex · 2026-09-04
- Tavus 发布 Sparrow-2:主打轮次检测与打断处理的对话理解模型 — ycombinator · 2026-09-04
- ARC-AGI-3 实测:max 推理多花 10 倍 token,总成本反降三成 — i_dg23 · 2026-09-04
- 研究者指 OpenAI Astra 系统卡存在数学基准数据污染疑点 — dfrsrchtwts · 2026-09-04