Claude Opus 5.5 登顶 AA 智能指数,降价 20% 且缓存读取价砍六成
geoffwolfe · x · 2026-09-26
Artificial Analysis 宣布 Claude Opus 5.5 以 max effort 拿下 58 分,登顶其 Intelligence Index,领先此前最高分数个点,同时 Anthropic 降价至 $4/$20 每百万输入/输出 token(原 Opus 5 为 $5/$25),缓存读取从 $0.50 降至 $0.20。
- 在十项评测中六项领先:Humanity's Last Exam 61.4%(前纪录 59.1%)、SciCode 66.9%(前纪录 63.1%)等;Terminal-Bench 4.0 得 59.6%,与 GPT-6 Astra (xhigh) 持平,比 Opus 5 高 11 分
- 智能体知识工作领先:私有评测 AA-Briefcase 上 Elo 达 1822,比 Fable 5.1 高 143 分,首次在呈现质量上超过 GPT-5.6 Sol
- 代价是 token 消耗:每个 Intelligence Index 任务约输出 11.9 万 token,是 Opus 5(7.3万)的 1.6 倍、GPT-6 Astra(2.7万)的 4 倍多,但单任务成本与 Opus 5 持平
- 五档 effort 中四档位于智能-成本前沿;在 CritPt、AA-LCR、GDP.pdf 上仍落后
「模型」频道最新
- Qwen 团队发布全模态智能体报告:Qwen3.8-Omni-Flash 配百万上下文 — dair_ai · 2026-09-26
- GPT-6 Sol 登 Agent Arena 榜第6,成本仅竞品44%改写性价比前沿 — arena · 2026-09-26
- Matt Shumer 称 Opus 5.5 自作主张在其网站里藏直升机彩蛋 — mattshumer_ · 2026-09-26
- 一个两栖动物问题就能识别模型评测:研究者提出 spurious probe — AdtRaghunathan · 2026-09-26
- Perceptron 发布 Mk1.5:单一模型驱动无人机、机器狗与智能眼镜 — code_star · 2026-09-26
- 实测者吐槽 Astra:完全不解人类情绪,Fable 和 Opus 碾压它 — teortaxesTex · 2026-09-26