GPT-6 Astra 对决 Opus 5.5:知识工作碾压,硬核数学仍是 OpenAI 地盘

johnseach · x · 2026-09-23

一篇详细的双模型对比。在 Artificial Analysis 智能指数上,Opus 5.5 以 58 分居首,Astra 和 Fable 5.1 为 53,旧 Opus 5 为 51。

价格差距明显:Opus 5.5 为 $4/$20 每百万 token,Astra 为 $10/$50;缓存读取 $0.20 vs $1.00,Opus 便宜约 60%。但 Astra 输出 token 极省(同任务约 27k vs 119k),实际账单差距比标价小得多。

编码胜负难分:Anthropic 自家数据显示 Opus 5.5 在 Terminal-Bench 4.0 拿 66.4% 对 Astra 的 57.9%,但 Artificial Analysis 同框架跑分两者基本打平(约 59–60%)。厂商图表总是偏向自家,独立跑分更可信。

知识工作是 Opus 5.5 的完胜:GDPval-AA 1846 Elo 对 1542,带工具的 Humanity's Last Exam 67.7% 对 57.2%。长报告、repo 迁移、长 agent 任务选 Opus。

Astra 仍占硬核 STEM 与网络攻击:FrontierMath Tier 4 达 97.6%,ExploitBench 100%(已达 OpenAI 关键网络阈值,能力被门控),ScreenSpot-Pro 92.7%。

结论:日常主力选 Opus 5.5,前沿数学、终端科学任务、屏幕操作和门控网络攻击留给 Astra。OSWorld 分数因评分规则不同不可直接比较。两模型上下文窗口与输出上限接近(1M/1.05M 上下文,128K 输出)。

所属事件:Claude Opus 5.5 发布即登顶智能指数,降价提速引发热议(50 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →