专题 · FULL STORY
Claude Opus 5:登顶SOTA与多维度实测
Claude Opus 5 曝光后迅速在多榜单综合登顶成为新SOTA。随后实测显示其与竞品能力趋同,但在视觉评测中表现落后且成本高昂,选型面临权衡。
2026-07-25 ~ 2026-07-26 · 3 集 · 17 条
第 1 集 · Claude Opus 5 曝光:多榜单综合登顶成新 SOTA(2026-07-25,6 条)
Claude Opus 5 在最新曝光的多个第三方基准测试榜单中表现出色,综合能力登顶成为新的全局 SOTA(当前最优模型)。在 Artificial Analysis 和 BenchmarkList 的评测中,它均超越了 Claude Fable 5 等竞品,引发了社区的广泛关注。
已确认
根据 Artificial Analysis 更新的榜单,Claude Opus 5 在 Intelligence Index 上获得了 61 分,综合排名第一,略高于 Claude Fable 5。此外,@davidthesong 提供的 BenchmarkList 截图显示,Claude Opus 5 被标记为新的全局 SOTA 第 1 名,其覆盖了 52 个基准,实验性 ECI 评分为 154.80。在衡量现实工作表现的 GDPval-AA v2 榜单中,同样有截图证实 Opus 5 的排名领先于 Fable 5。
尚未确认
@Hesamation 指出,尽管 Claude Opus 5 在综合智能指数上登顶,但在编程代理(Coding Agent)细分能力上,Fable 5 依然保持领先。
为什么重要
Claude Opus 5 在综合智能指数上的登顶,标志着大模型能力天花板的再次提升。同时,Opus 5 与 Fable 5 在通用能力与编程代理任务上的差异化表现,为开发者在不同应用场景下的模型选择提供了明确的参考依据。
- Artificial Analysis 榜单显示 Claude Opus 5 领先 Fable 5 — Leonardo-editing · 2026-07-25
- Claude Opus 5 在模型能力图上位居前列 — scaling01 · 2026-07-25
- Claude Opus 5 综合登顶,Fable 5 仍领跑编程代理 — Hesamation · 2026-07-25
- Claude Opus 5 登顶 BenchmarkList 成为新全球 SOTA — davidthesong · 2026-07-25
- Claude Opus 5 在 Artificial Analysis 上略胜 Claude Fable 5 — thesaraharminta · 2026-07-25
- Claude Opus 5 登顶 Artificial Analysis,分数达到 61 — Rare_Bunch4348 · 2026-07-25
第 2 集 · Opus 5 与 GPT-5.6 Sol 实测:能力趋同,成本与风格成选型关键(2026-07-25,7 条)
在浏览器自动化智能体 Hyperagent 的真实任务实测中,Opus 5 与 GPT-5.6 Sol 展现出截然不同的特性与成本结构。当前行业旗舰模型的核心能力已趋于一致,竞争焦点正从单纯的“谁更能干”转向模型在真实任务中的风格、稳定性与调用成本。
已确认
根据 @PrajwalTomar 与 @TawohAwa 分享的测试结果,Opus 5 在多项能力上表现突出:它的表达更清晰,在浏览器任务和基于复杂数据进行决策时表现优异。然而,Opus 5 存在明显的“性格税”,即输出风格偏啰嗦且偏向保守,导致单次调用成本较高。相比之下,GPT-5.6 Sol 的输出更为精简,在 5 个相近的测试用例中均展现出更低的成本优势,具备更好的落地可行性。
尚未确认
关于 Opus 5 的整体性价比,目前存在不同视角的评估。虽然 GPT-5.6 Sol 在单任务测试中更便宜,但 @danielmac8 指出,如果参考 AA-Index 的单任务成本图来反驳 Opus 5 的性价比是“用错了场景”。他认为,单轮任务数据无法体现长链路 agent 任务中的效率优势;在长链路任务中,Opus 5 的强大能力可能会减少整体试错次数,从而在综合成本上更具优势。
为什么重要
随着 AI Agent 走向商业化,模型选型逻辑正在发生根本改变。正如 @PrajwalTomar 所强调,当 agent 被部署到真实规模、覆盖多客户并长期运行时,微小的单次调用成本差异会直接转化为企业的利润差。同时,高风险推理任务依然需要更强大的模型支撑。因此,开发者需要在“昂贵但强大的高阶推理”与“精简低成本的规模化落地”之间寻找平衡。
- Hyperagent:Opus 5 更强,但 GPT-5.6 Sol 更便宜更好落地 — TawohAwa · 2026-07-25
- Opus 5 在长链路 agent 任务上更省成本 — daniel_mac8 · 2026-07-25
- 旗舰模型的差别,正在从能力转向风格、稳定性和成本 — PrajwalTomar_ · 2026-07-25
- Hyperagent 测试:Opus 5 更清晰,GPT-5.6 Sol 更精简也更便宜 — PrajwalTomar_ · 2026-07-25
- GPT-5.6 Sol 在 5 个测试里更便宜,Agent 成本差会变成利润 — PrajwalTomar_ · 2026-07-25
- Opus 5 对比 GPT-5.6 Sol 实测:能力各有千秋,后者成本大幅领先 — PrajwalTomar_ · 2026-07-26
- Opus 5 对比 GPT-5.6 Sol:浏览器任务与分析能力更关键 — Aiden_Tech_Ai · 2026-07-26
第 3 集 · Claude Opus 5 视觉评测落后且成本高昂(2026-07-25,4 条)
在 EyeBench-V3 基准测试中,Claude Opus 5 虽然超越了同门的 Fable 5 成为 Anthropic 表现最好的模型,但整体性能依然落后于 GPT 和 Gemini。成本方面,尽管 Opus 5 的运行成本比 Fable 5 低约 14%,但其输出极为冗长,生成的 Token 数量约为后者 2.5 倍,导致单任务成本逼近 GPT 5.6 Sol 的两倍。
- Claude Opus 5 在 EyeBench-V3 上压过 Fable 5 但仍落后 GPT 和 Gemini — adonis_singh · 2026-07-25
- Opus 5 在 EyeBench-V3 上比 Fable 5 便宜 14%,却多输出 2.5 倍 token — adonis_singh · 2026-07-25
- 实测 Opus 与 Fable 成本:输出冗长致费用逼近 — adonis_singh · 2026-07-25
- 图表显示 Claude Opus 5 单任务成本约为 GPT 5.6 Sol 的两倍 — soumitrashukla9 · 2026-07-25