Claude Opus 5 登上 Agent Arena 第二名,领先 GPT-5.6 Sol
scaling01 · x · 2026-07-29
Claude Opus 5 在 Agent Arena 排到前二,超过 GPT-5.6 Sol
转发的 Arena 数据显示,Anthropic 的 Claude Opus 5 Max 在 Agent Arena 中升到第 2,Opus 5 High 排第 3,统计基于 7000 多个真实 agent 会话。
- Opus 5 Max:第 2,净提升 11.88%
- Opus 5 High:第 3,净提升 11.73%
- 两个版本都紧跟 Fable 5,领先 GPT-5.6 Sol
- 该榜单覆盖带网页、文件系统和终端工具的长链路任务
- 结果反映的是真实 agent 工作流中的 outcome 表现
所属事件:Agent Arena 榜单:Claude Opus 5 跑赢 GPT-5.6(4 条相关)→
「模型」频道最新
- OpenAI 调整 Sol 额度:工具型任务可多用约 18% — soumitrashukla9 · 2026-07-30
- Fireship 认为 Anthropic 的 Opus 5 正在挤压独立开发者护城河 — Fireship · 2026-07-30
- Apertus 1.5 发布:支持多模态与超长上下文 — ZhijingJin · 2026-07-30
- Zvi设赌局:Opus 5能否在Spires基准上击败Sol? — TheZvi · 2026-07-30
- Gemini 3.5 Flash 和 3.6 Flash 视觉推理表现亮眼 — rseroter · 2026-07-30
- Google DeepMind 发布 Lyria 3.5 音乐生成模型 — Google DeepMind · 2026-07-30