GPT-6 Astra 引爆 AGI 争论:ARC-AGI-3 成绩 99.9% 与 62.7% 的口径之争
johnseach · x · 2026-09-06
OpenAI 于 9 月 3 日发布 GPT-6 Astra,Greg Brockman 对媒体称「欢迎来到 AGI 时代」,但作者认为能力跃升是真的,AGI 标签则不是。
- 模型能力:Astra 是强工具使用型 agent,电脑操作远超 GPT-5.6 Sol,能处理表单、浏览器、CRM、日历,操作 KiCad、Unity、CAD 等真实软件;FrontierMath Tier 4 约 98%,是首个达到 OpenAI 内部「Critical」网络威胁阈值的模型(公开版仍拒绝高级漏洞利用)
- 规格与价格:上下文约 105 万 token,API 约 $10/$50 每百万输入/输出 token,先向可信组织和付费用户开放
- 关键小字:刷屏的 ARC-AGI-3 99.9% 用的是 OpenAI 自家 Provider Adapter harness(保留推理状态、压缩长程运行);ARC Prize 标准环境下同一模型约 62.7%。两个成绩都真实,但测的是不同系统
- AGI 定性:无公认测试标准,Altman 自己刚说过 AGI 是「定义模糊的营销词」;Astra 仍是无身体的屏幕+API agent,Claude Fable 5.1 等前沿模型在编码与 agent 指数上紧咬
结论:把它当作 agentic 电脑操作的实质跳跃,而非「欢迎来到 AGI 时代」的科学结论。
所属事件:OpenAI 发布 GPT-6 Astra,性能破纪录并引发 AGI 之争(8 条相关)→
「模型」频道最新
- 知情人称下周将发布的演示远超 OpenAI 官方博客与宣传片 — ChrisGPT · 2026-09-06
- GPT-6 Astra 系统卡:首个达网络安全 Critical 级的模型,监测与对齐细节公开 — RyanGreenblatt · 2026-09-06
- ChatGPT 重置卡实际是顺延日期,临期使用性价比极低被吐槽 — dotey · 2026-09-06
- 网友用 GPT-6 Astra 在浏览器里做游戏,连车模都用 Blender 建好了 — gaganghotra_ · 2026-09-06
- 开发者观察:GPT Astra 口碑碾压 Fable 5.1 — gaganghotra_ · 2026-09-06
- OpenAI 朋友称 Astra 令人震撼:"别再纠结基准测试了" — Yuchenj_UW · 2026-09-06