Claude Opus 5 登上 Agent Arena 第二名,领先 GPT-5.6 Sol
scaling01 · x · 2026-07-29
Claude Opus 5 在 Agent Arena 排到前二,超过 GPT-5.6 Sol
转发的 Arena 数据显示,Anthropic 的 Claude Opus 5 Max 在 Agent Arena 中升到第 2,Opus 5 High 排第 3,统计基于 7000 多个真实 agent 会话。
- Opus 5 Max:第 2,净提升 11.88%
- Opus 5 High:第 3,净提升 11.73%
- 两个版本都紧跟 Fable 5,领先 GPT-5.6 Sol
- 该榜单覆盖带网页、文件系统和终端工具的长链路任务
- 结果反映的是真实 agent 工作流中的 outcome 表现
所属事件:Agent Arena 榜单:Claude Opus 5 跑赢 GPT-5.6(4 条相关)→
「模型」频道最新
- 网友实测称未发布的 Claude Opus 5.5 视觉设计能力最强 — MickeySteamboat · 2026-09-23
- Anthropic 团队成员称已修复 Opus 5.5 的写作能力 — dreamwieber · 2026-09-23
- 继续实测:6 个 luna 模型照图作画,结果出乎意料地不差 — adonis_singh · 2026-09-23
- 用 computer use 让模型照参考图作画,Opus 与 Astra 实测对比 — adonis_singh · 2026-09-23
- AI 玩狼人杀说服众人投出对手,最终获胜 — pbbakkum · 2026-09-23
- 博主实测称 Anthropic Opus 5.5 对话体验出色 — daniel_mac8 · 2026-09-23