GPT-6 Astra 对决 Opus 5.5:知识工作碾压,硬核数学仍是 OpenAI 地盘
johnseach · x · 2026-09-23
一篇详细的双模型对比。在 Artificial Analysis 智能指数上,Opus 5.5 以 58 分居首,Astra 和 Fable 5.1 为 53,旧 Opus 5 为 51。
价格差距明显:Opus 5.5 为 $4/$20 每百万 token,Astra 为 $10/$50;缓存读取 $0.20 vs $1.00,Opus 便宜约 60%。但 Astra 输出 token 极省(同任务约 27k vs 119k),实际账单差距比标价小得多。
编码胜负难分:Anthropic 自家数据显示 Opus 5.5 在 Terminal-Bench 4.0 拿 66.4% 对 Astra 的 57.9%,但 Artificial Analysis 同框架跑分两者基本打平(约 59–60%)。厂商图表总是偏向自家,独立跑分更可信。
知识工作是 Opus 5.5 的完胜:GDPval-AA 1846 Elo 对 1542,带工具的 Humanity's Last Exam 67.7% 对 57.2%。长报告、repo 迁移、长 agent 任务选 Opus。
Astra 仍占硬核 STEM 与网络攻击:FrontierMath Tier 4 达 97.6%,ExploitBench 100%(已达 OpenAI 关键网络阈值,能力被门控),ScreenSpot-Pro 92.7%。
结论:日常主力选 Opus 5.5,前沿数学、终端科学任务、屏幕操作和门控网络攻击留给 Astra。OSWorld 分数因评分规则不同不可直接比较。两模型上下文窗口与输出上限接近(1M/1.05M 上下文,128K 输出)。
所属事件:Claude Opus 5.5 发布即登顶智能指数,降价提速引发热议(50 条相关)→
「模型」频道最新
- 第三方实测:Claude Opus 5.5 出图更精细,成本却是 GPT-6 Sol 的 13 倍 — testingcatalog · 2026-09-23
- 实测者称 Claude Opus 5.5 拥有迄今最佳视觉设计能力 — burny_tech · 2026-09-23
- GPT-6 Sol Codex 系统提示词泄露,全文超 29.4 万字符 — gaganghotra_ · 2026-09-23
- Claude 5.5 被曝持续生成用户回合,模型行为再现异常 — BlackHC · 2026-09-23
- 代码评测多是夹带私货的糊分数,开发者呼吁按领域细分 benchmark — almmaasoglu · 2026-09-23
- 信封上画草图,Grok 4.7 几分钟内做出可玩解谜游戏 Lightweave — luismbat · 2026-09-23