Zvi 评 GPT-6 Astra:智力跃升史上最大,AGI 之争首次不显荒唐
Don't Worry About the Vase (Zvi) · rss · 2026-09-13
Zvi 长文评 OpenAI 发布的 GPT-6 Astra:
核心判断
- Sol→Astra 的跃升大于 Fable 5→5.1;Astra 原始智力因子为历代最高,是「雄心项目」、3D、游戏、computer use、子 agent 协调的最强模型,多项基准大幅跳升
- 但并非全面碾压:Fable 5.1 在来回讨论、写作等场景仍是首选;建议难问题上两个模型都用
- 常规编码进步不大;这是第一次「是不是 AGI」的争论不显得荒唐——Zvi 认为还不是,但不会嘲笑持不同意见者
官方口径与反响
- Greg Brockman 宣称「欢迎来到 AGI 时代」,Sam Altman 称其为世界最佳 computer use/专业工作/科学/编码/网络安全模型;官方数据:FrontierMath Tier 4 达 98%、ARC-AGI 3 达 99.9%、ExploitBench 100%
- 发布视频在 Twitter 播放 1.25 亿次;Jensen Huang 也称其为 AGI
- Tibo 称 Astra 内测期间是公司最大竞争优势,产品计划因此提前 6 个月到 DevDay 发布;Dean W. Ball 称 Astra 是第一个「反过来抬高我野心」的 agent
- OpenAI 已软性透露内部还有高于 Astra 一级的模型;roon 称 Astra 的极限「不到一周就被摸到」
背景:Anthropic 节奏提案
文末引 Dario Amodei 新文《We Must Pace the Frontier》,核心为三步:前沿公司单边承诺接受 METR 等第三方嵌入式评估员(Anthropic 即刻承诺);民主国家前沿公司协调安全标准与进度限制;再尝试与威权政府全球协调。Zvi 将在下期完整覆盖。
其他
Astra 官方自述提到因安全与对齐标准而延迟发布,Mark Chen 强调对齐仍未解决、需与能力同步推进。后续待写:Navier-Stokes、Anthropic 失对齐报告、模型福祉等。
「漫话AGI」频道最新
- Gary Marcus:人类五年灭绝与一切都会好,两种叙事都荒谬 — GaryMarcus · 2026-09-14
- 一种新直觉:30 年后正常的世界,多半是因为 AI 曾被暂停 — EigenGender · 2026-09-14
- Sam Altman 列出 AI 两大生存威胁:失控与权力过度集中 — sama · 2026-09-14
- Spotify 论文:Agent 时代推荐系统的受众正从人变成 AI — _reachsumit · 2026-09-14
- 公开信质疑前沿 AI 放缓呼吁:评估员只是通道,状态仍在推进 — AryHHAry · 2026-09-14
- 冯·诺依曼探测器能否防价值漂移?星际尺度的演化难题 — louisvarge · 2026-09-14