Opus 5 基准图曝光,编码、搜索和电脑操控全面领跑
CtrlAltDwayne · x · 2026-07-25
这条帖子在夸 Anthropic 的 Opus 5,并配了一张对比图,把它和 Fable 5、Opus 4.8、GPT-5.6 Sol 放在一起看多项基准表现。
图里最醒目的结果包括:
- Agentic terminal coding:43.3%
- Knowledge work:1861
- Agentic search:90.8%
- Computer use:70.6%
- Agentic coding(DeepSWE v1.1):68.8%
- Agentic coding(FrontierCode v1.1):53.4%
图表还显示它在法律、健康和多学科推理上表现不一;其中多学科推理分成有无工具两种条件,结果也分别给出。
所属事件:Anthropic Opus 5 基准图曝光,多项智能体能力领跑(2 条相关)→
「模型」频道最新
- Claude Opus 5 用 27% 订阅额度做出赛车克隆 — soumitrashukla9 · 2026-07-25
- Opus 5 在 Boeing 基准上加入数值自检 — victormustar · 2026-07-25
- 转发帖质疑 Claude 基准图只挑出 GPT-5.6 Sol 唯一赢项 — soumitrashukla9 · 2026-07-25
- SlopCodeBench 实测里 Opus 5 领先 Opus 4.8 和 Sonnet 5 — HamelHusain · 2026-07-25
- 新模型实测:速度与性价比兼具的 Agent 主力 — doodlestein · 2026-07-25
- Claude Opus 5 被指在 3D 编码测试上胜过 Fable 5 — rohanpaul_ai · 2026-07-25