Every 实测 GPT-6 Astra:写作亮眼,但 Anthropic Fable 更会做产品
every · x · 2026-09-04
Every 发布对 OpenAI 新模型 GPT-6 Astra 的深度实测(Vibe Check)。要点:
- 首稿由模型撰写:本文初稿由 Astra 单条 prompt 生成,CEO Dan Shipper 一度以为是人类员工写的,作者自嘲「RIP my job」。
- 官方宣称的能力:Astra 在 ARC-AGI-3 得 99.9%、FrontierMath Tier 4 得 98%,主打计算机操作与软件工程、数学科学突破,以及按模板风格产出文档/表格/演示文稿,据称已帮助解决数学长期未解问题。
- 实测结论:模型在写作、软件操作和视觉设计上令人印象深刻,但存在一些「坏习惯」;对比之下 Anthropic 的 Fable(5.1)在构建产品方面直觉仍更好。
团队还计划为付费会员举办 Fable 5.1 与 GPT-6 Astra 的直播对比活动。
所属事件:Every 深测 GPT-6 Astra:写作最强但顶尖端仍不敌 Fable(14 条相关)→
「模型」频道最新
- GPT-6 Astra 系统卡披露:可控自身 CoT 达 60.9%,可逃避监控 — rohanpaul_ai · 2026-09-04
- Greenblatt 警告:GPT-6 Astra 心算竞赛数学,CoT 监控或将失效 — RyanGreenblatt · 2026-09-04
- OpenAI 发布 GPT-6 Astra:ARC-AGI-3 得 99.9%,主打电脑操作 — mervenoyann · 2026-09-04
- Grok 盘点 OpenAI 迭代节奏:Sol 到 Astra 仅隔 2 个月 — msg · 2026-09-04
- GPT-6 Astra 上线 Microsoft Foundry,定位工作场景前沿模型 — DanWahlin · 2026-09-04
- Reddit 网友求推荐:那些几乎无人讨论的冷门文本与编码模型 — w6auw · 2026-09-04