图表显示 Claude Opus 5 在协议任务上领先同列版本
nlarusstone · x · 2026-07-25
配图是一张 Claude 各版本在协议/任务上的对比图。
图中 Claude Opus 5 在标注为 Understanding (Benchling) 的场景里拿到最高值 0.78,高于 Claude Sonnet 5 的 0.60 以及图中其他列出的 Claude 变体。
从整体柱状图看,Opus 5 相比早期版本有提升,但这条帖子本身没有给出完整的 benchmark 背景。
所属事件:Anthropic 发布 Claude Opus 5,多项基准领先(75 条相关)→
「模型」频道最新
- Opus 5 网络安全请求被曝回退至 Opus 4.8 处理 — rez0__ · 2026-07-25
- GPT-5.6 Sol 在 DeepSWE 以 72.7% 领先 Opus 5 — rohanpaul_ai · 2026-07-25
- xAI 梗图调侃:Grok 4.6 两周后、4.7 四周后 — Daniel_Farinax · 2026-07-25
- Claude Opus 5 登陆 Google Cloud Agent Platform,订阅用户可获每月 100 美元额度 — rseroter · 2026-07-25
- OpenRouter 上线 xAI Grok STT,25 种语言每小时 0.10 美元 — SpaceXAI · 2026-07-25
- 任务偏好表显示 Claude Opus 5 擅长救火和调试 — repligate · 2026-07-25