Opus 5.5 登 Agent Arena 第二:效果超 Opus 5,成本降 40-56%
arena · x · 2026-09-29
Agent Arena(agent 任务实时排行榜,超 205 万 sessions)发布最新数据,Claude Opus 5.5 (High) 排名第二并重塑 Pareto 前沿:
- Opus 5.5 (High):每任务中位成本 $1.31,净改进 +12.15%,净改进分超过两款 Opus 5,而成本比 Opus 5 (Max) ($2.98) 低 56%、比 Opus 5 (High) ($2.17) 低 40%。
- Pareto 前沿上的其他模型:Claude Fable 5.1 (Max) +13.84% / $3.51,GPT 6 Sol (Max) +8.18% / $0.82,腾讯 Hy4 preview +4.25% / $0.20,DeepSeek V4.1 Flash +3.96% / $0.07。
- 完整榜单还包括 Kimi K3、Grok 4.7、Gemini 3.8 Flash 等 45 个模型,按工具可靠性、任务完成度与可操控性等信号动态排名。
所属事件:Claude Opus 5.5 登 Agent Arena 第二,成本大幅下降(2 条相关)→
「模型」频道最新
- 创业者称 Opus 5.5 按其个人基准已是 AGI,或将不再把任务交给人 — jonathan_wilke · 2026-09-29
- Opus 5.5 邮件写作中的破折号用量大幅下降 — jonathan_wilke · 2026-09-29
- Sonnet 5.5 刷新 Arena 输出token纪录,Astra 更便宜引热议 — Gohab2001 · 2026-09-29
- PrivacyBench v2 发布:flow-transform 1.0 以 95.84% 登顶企业去标识化评测 — Exp_Mark · 2026-09-29
- 用户吐槽 Astra 隔夜大变脸:昨天 30 分钟秒解难题,今天绕圈一整天 — HairyHobNob · 2026-09-29
- Grok 4.7 xHigh 登顶 Artificial Analysis 网络安全指数 — XFreeze · 2026-09-29