Opus 5.5 登顶 AA 榜 58 分,代价比 Astra 便宜 60% 但吃 token 更凶
johnseach · x · 2026-09-23
Anthropic 发布 Claude Opus 5.5,与三周前亮相的 OpenAI GPT-6 Astra 正面对撞:同为 1M 级上下文、128K 输出上限,但押注方向截然不同。
综合评测:在 Artificial Analysis Intelligence Index 上,Opus 5.5 以 58 分登顶第一,Astra 与 Fable 5.1 同为 53,旧 Opus 5 为 51。Opus 在十项测试中领跑六项,优势最大的是知识型工作与长程 agent 任务。
价格:Opus 5.5 为 $4/$20(输入/输出每百万 token),Astra 为 $10/$50;缓存读取 $0.20 对 $1.00——Opus token 便宜约 60%、缓存便宜 5 倍。但 Astra 更省 token:同一测试下每任务约 27k 对 Opus 的 119k,实际账单差距比标价小。
编码:两家各自发布自家有利的表格(Anthropic 称 Opus 66.4% vs 57.9% on Terminal-Bench 4.0),同一 harness 下的独立测试显示两者约打平(59-60%)。作者提醒:厂商图表总是偏袒自家。
各自强项:
- Opus 知识工作碾压:GDPval-AA 1846 对 1542 Elo,AA-Briefcase 1822,HLE 带工具 67.7% vs 57.2%
- Astra 守住硬核 STEM 与网络攻防:FrontierMath Tier 4 达 97.6%,Terminal-Bench-Science 64.6%,ExploitBench 100%(OpenAI 已按 Critical 网络安全门槛做能力门控),ScreenSpot-Pro 92.7%
- OSWorld 计算机使用两边计分规则不同,不可直接比较
结论:这周只选一个日常主力就用 Opus 5.5——更便宜、长 agent 与知识工作更强;Astra 留给前沿数学、终端科学任务、重屏幕的计算机使用和(被门控的)网络攻防。
所属事件:Opus 5.5 发布即登顶智能指数,降价提速碾压 GPT-6(50 条相关)→
「模型」频道最新
- 小米发布 MiMo-V2.6:开源模型 AA 智能指数 46 分居首 — burny_tech · 2026-09-23
- OfirPress 质疑新榜单算法:子集挑题+平均通过率,掩盖任务真实完成度 — OfirPress · 2026-09-23
- Cline 宣称 MiMo-v2.6-Pro 登顶开源权重模型榜 — burny_tech · 2026-09-23
- Anthropic 自嘲式官宣:Opus 5.5 远胜 Opus 5,网友戏称该向旧模型道歉 — repligate · 2026-09-23
- Opus 5.5 创作实测:「建议你把想要的都画出来」 — repligate · 2026-09-23
- Ofir Press 解释第三方跑分更高:任务子集与计分口径不同 — OfirPress · 2026-09-23