GPT-6 Astra Launches with Strong but Disputed Benchmarks

OpenAI 于 9 月 4 日发布 GPT-6 Astra,官方称其为「世界最聪明、最对齐的模型」,并同步公开系统卡与部署安全评估报告(deploymentsafety.openai.com)。模型宣称在 ARC-AGI-3 上取得 62.7%(约为 Opus 5 的两倍),但发布后围绕跑分口径、综合实力与定价的争议迅速发酵。

已确认

尚未确认

为什么重要

Astra 的发布再次暴露了前沿模型跑分口径的脆弱性:同一基准在不同 harness 下可差出近 40 个百分点,第三方综合指数(AA)与官方宣传形成明显反差。同时其 2.5 倍的涨价、Agentic Index 落后于竞品,以及脑内推理导致 CoT 监控可能失效的安全担忧,都直接影响用户采购决策与前沿模型的安全治理框架。

2026-09-04 ~ 2026-09-04 · 117 related posts

Full story(6 episodes)→

Primary sources

8 near-duplicate retellings: yanndubs · ArtificialAnlys · ArtificialAnlys · ArtificialAnlys · ronbodkin · deanwball · SeunghyunSEO7 · maksym_andr