Claude Opus 5.5登顶AA指数达58,但单位任务成本与上代持平
qinzytech · x · 2026-10-07
Claude Opus 5.5 以 58 分登顶 Artificial Analysis 智能指数,但成本故事值得细看:token 单价下降 20%,而单个任务成本却与 Opus 5 持平。原因是输出量——max effort 下每道 Index 任务约生成 11.9 万输出 token(Opus 5 约 7.3 万),定价为输入 $4/百万、输出 $20/百万 token。
关键点:
- 十项评测中六项领先;Terminal-Bench 4.0 得 59.6%,与 GPT-6 Astra(xhigh)持平
- AA-Briefcase(专业工作)Elo 1822,在分析质量与表达上均胜 Claude Fable 5.1
- 五档 effort 中四档位于智能-成本前沿,选档值得对比
- 仍有短板:CritPt、AA-LCR、GDP.pdf 略落后
「模型」频道最新
- 700亿参数数学模型Bel引争论:合成数据还是规模红利 — teortaxesTex · 2026-10-07
- Fable 自评新发布:相当于约 5 个「OpenAI 纳维-斯托克斯」级成果 — willdepue · 2026-10-07
- Reddit 用户发布去审查 27B 红队安全模型,自称零拒绝 — Least_Dog_8556 · 2026-10-07
- OpenAI 研究员惊讶:AI 实验室数学新成果至今没查出硬伤 — willdepue · 2026-10-07
- OpenAI 模型在 ARC 类谜题上输给 Meta 的 Muse — BLUECOW009 · 2026-10-07
- Inception 免费推出 Mercury Decide:每秒 14 次结构化决策,对标 Jev — StefanoErmon · 2026-10-07