专题 · FULL STORY

Claude Opus 5:登顶SOTA与多维度实测

Claude Opus 5 曝光后迅速在多榜单综合登顶成为新SOTA。随后实测显示其与竞品能力趋同,但在视觉评测中表现落后且成本高昂,选型面临权衡。

2026-07-25 ~ 2026-07-26 · 3 集 · 17 条

第 1 集 · Claude Opus 5 曝光:多榜单综合登顶成新 SOTA(2026-07-25,6 条)

Claude Opus 5 在最新曝光的多个第三方基准测试榜单中表现出色,综合能力登顶成为新的全局 SOTA(当前最优模型)。在 Artificial Analysis 和 BenchmarkList 的评测中,它均超越了 Claude Fable 5 等竞品,引发了社区的广泛关注。

已确认

根据 Artificial Analysis 更新的榜单,Claude Opus 5 在 Intelligence Index 上获得了 61 分,综合排名第一,略高于 Claude Fable 5。此外,@davidthesong 提供的 BenchmarkList 截图显示,Claude Opus 5 被标记为新的全局 SOTA 第 1 名,其覆盖了 52 个基准,实验性 ECI 评分为 154.80。在衡量现实工作表现的 GDPval-AA v2 榜单中,同样有截图证实 Opus 5 的排名领先于 Fable 5。

尚未确认

@Hesamation 指出,尽管 Claude Opus 5 在综合智能指数上登顶,但在编程代理(Coding Agent)细分能力上,Fable 5 依然保持领先。

为什么重要

Claude Opus 5 在综合智能指数上的登顶,标志着大模型能力天花板的再次提升。同时,Opus 5 与 Fable 5 在通用能力与编程代理任务上的差异化表现,为开发者在不同应用场景下的模型选择提供了明确的参考依据。

第 2 集 · Opus 5 与 GPT-5.6 Sol 实测:能力趋同,成本与风格成选型关键(2026-07-25,7 条)

在浏览器自动化智能体 Hyperagent 的真实任务实测中,Opus 5 与 GPT-5.6 Sol 展现出截然不同的特性与成本结构。当前行业旗舰模型的核心能力已趋于一致,竞争焦点正从单纯的“谁更能干”转向模型在真实任务中的风格、稳定性与调用成本。

已确认

根据 @PrajwalTomar 与 @TawohAwa 分享的测试结果,Opus 5 在多项能力上表现突出:它的表达更清晰,在浏览器任务和基于复杂数据进行决策时表现优异。然而,Opus 5 存在明显的“性格税”,即输出风格偏啰嗦且偏向保守,导致单次调用成本较高。相比之下,GPT-5.6 Sol 的输出更为精简,在 5 个相近的测试用例中均展现出更低的成本优势,具备更好的落地可行性。

尚未确认

关于 Opus 5 的整体性价比,目前存在不同视角的评估。虽然 GPT-5.6 Sol 在单任务测试中更便宜,但 @danielmac8 指出,如果参考 AA-Index 的单任务成本图来反驳 Opus 5 的性价比是“用错了场景”。他认为,单轮任务数据无法体现长链路 agent 任务中的效率优势;在长链路任务中,Opus 5 的强大能力可能会减少整体试错次数,从而在综合成本上更具优势。

为什么重要

随着 AI Agent 走向商业化,模型选型逻辑正在发生根本改变。正如 @PrajwalTomar 所强调,当 agent 被部署到真实规模、覆盖多客户并长期运行时,微小的单次调用成本差异会直接转化为企业的利润差。同时,高风险推理任务依然需要更强大的模型支撑。因此,开发者需要在“昂贵但强大的高阶推理”与“精简低成本的规模化落地”之间寻找平衡。

第 3 集 · Claude Opus 5 视觉评测落后且成本高昂(2026-07-25,4 条)

在 EyeBench-V3 基准测试中,Claude Opus 5 虽然超越了同门的 Fable 5 成为 Anthropic 表现最好的模型,但整体性能依然落后于 GPT 和 Gemini。成本方面,尽管 Opus 5 的运行成本比 Fable 5 低约 14%,但其输出极为冗长,生成的 Token 数量约为后者 2.5 倍,导致单任务成本逼近 GPT 5.6 Sol 的两倍。