专题 · FULL STORY

Claude Opus 5:从发布传闻到实测霸榜

Anthropic模型发布历经混乱传闻后,于7月25日正式推出Claude Opus 5。新模型不仅大幅精简系统提示词,更在编程、推理及多榜单实测中登顶SOTA,引发社区热烈讨论。

2026-07-20 ~ 2026-07-25 · 17 集 · 167 条

第 1 集 · Claude Code 系统提示词大幅缩减 80%(2026-07-20,4 条)

Anthropic 大幅缩减了 Claude Code 的系统提示词,减幅高达 80%。随着模型能力不断进化,传统的提示词技巧可能适得其反,更强的新模型需要全新的交互方式。开发者不能再将它们视作低能力模型进行过度约束,以往针对旧模型有效的指令和示例,如今反而可能拖累输出表现。

第 2 集 · 逆向分析称Claude Code提示词实际缩减约70%(2026-07-22,2 条)

针对网传 Claude Code 系统提示词被大幅削减 80% 的消息,有开发者通过伪造 ANTHROPIC_BASE_URL 成功捕获了 6 个模型的真实提示词文本。逆向分析结果表明,所谓的“砍掉 80%”有些夸张,前沿模型上的实际提示词长度缩减比例更接近 70%。

第 3 集 · Anthropic 模型发布陷混乱,Opus 5 被指关乎成败(2026-07-23,2 条)

Anthropic 近期的模型发布被批陷入混乱与反复横跳:Opus 4.8 仅做了 token 修补,Fable 5 发布后迅速被撤,Sonnet 5 在基准测试中甚至跑输旧版。知名开发者 antirez 指出,公司的这些问题并非始于 Fable,而是早在 Opus 4.7 时就已显现。他认为即将推出的下一代 Opus 5 将是一次决定 Anthropic 成败的关键发布。

第 4 集 · Anthropic 发布 Claude Opus 5:性能达 SOTA 且价格减半(2026-07-25,106 条)

7 月 25 日,Anthropic 正式发布前沿模型 Claude Opus 5。官方将其定位为一款更具思考力与主动性的模型,主要面向复杂任务。该模型在多项编程与知识工作评测中达到新的 SOTA,整体智能水平接近 Fable 5,但 token 价格仅为后者的一半。目前新模型已确认在付费层及 Box 平台上线。

已确认

* **模型定位与价格**:Claude Opus 5 被官方定义为一款更“周到、主动”的思考型模型。在定价策略上,其 token 价格为每百万 $5 / $25,与 Opus 4.8 持平,约为 Fable 5 价格的一半。不过,@bindureddy 指出其在相似任务上的实际花费可能比 4.8 贵约 15%,但整体仍算严格升级。@alexalbert__ 补充称,团队优化了跨领域 token 效率,使其在使用时更省 token。

* **基准表现(SOTA)**:官方及多位关注者提供的图表显示,Opus 5 在多数基准上取得领先。具体数据包括:终端编码达到 43.3%,ARC-AGI-3 得分 30.2%,并在 SimpleBench 上排到第二名(仅落后 Fable 1%、落后人类 3%)。对比对象涵盖 Fable 5、Opus 4.8 和 GPT-5.6 Sol。

* **安全与对齐**:@Polymarket 转述 Anthropic 的说法,称 Opus 5 是其目前“最对齐”的模型,观察到的鲁莽或欺骗行为率最低。

* **上线情况**:新模型已确认在付费层可用,@Matthew Berman 提到该模型也已上线 Box 平台。

为什么重要

Opus 5 的发布直接挑战了竞争对手的定价模式。通过将顶尖的基准性能(特别是在编码和多步智能体任务上)与减半的竞品 token 价格结合,Anthropic 有望大幅降低开发者与企业使用复杂 AI 模型的门槛,进一步加剧前沿大模型市场的竞争。

还有 86 条相关讨论 →

第 5 集 · 网传 Anthropic 发布 Opus 5,支持加速与科研顶配(2026-07-25,3 条)

网传 Anthropic 已发布 Opus 5 模型。据称该模型提供速度约为默认 2.5 倍的 Fast mode,基础价格随之翻倍,且通用 API 无数据留存要求。此外,它将成为科研领域的顶配选择。在能力方面,Opus 5 的视觉输出被指有明显提升,其中展示红色汽车气流表现的风洞 demo 尤为惊艳,引发社区广泛关注。

第 6 集 · Claude Opus 5 疑似曝光:编码能力提升但破坏旧工作流(2026-07-25,6 条)

Anthropic 疑似发布了 Claude Opus 5 模型,目前该模型已接入 Claude Code 与 ClickUp Brain。早期测试普遍认为其能力较 Opus 4.x 显著提升,核心亮点在于更强的自我纠错与任务执行能力,但它对现有的自动化工作流造成了破坏,引发了开发者对模型兼容性与提示词重构的关注。

已确认

根据早期测试者的反馈,Claude Opus 5 在中等强度的编码场景下表现优异,能够很好地辅助开发者快速产出 PR(Pull Requests)。模型不再仅仅提供初稿,而是具备了更强的自主执行与纠错能力。Anthropic 的发布文案也将其描述为一款更“深思熟虑”的模型。此外,用户 @tengyanAI 指出,由于模型能力升级,4.x 时代的诸多提示词“好习惯”(如反复要求“验证”或额外开子任务检查产出)在 Opus 5 中已变得多余,只会白白浪费 token。

尚未确认

关于模型的具体版本号、官方完整发布时间以及最终定价,目前提供的材料中并未提及,尚待官方进一步确认。

为什么重要

虽然 Opus 5 的单点编码能力备受肯定,但它暴露出了与现有工作流的严重兼容性痛点。多位测试者(如 Kieran Klaassen)指出,如果将 Opus 5 放入 Compound Engineering 等本应自动运行的复杂流程中,它会“弄坏”这些流程。此外,模型在运行中会与指令“顶嘴”,在过度依赖复杂 skills 和超长 prompt 时表现受限。这意味着开发者在升级模型以获取更强性能的同时,必须彻底重构现有的自动化开发工作流与提示词习惯。

第 7 集 · Anthropic发布Claude Opus 5实测表现亮眼(2026-07-25,3 条)

Anthropic发布了Claude Opus 5模型。实测表明,该模型在编码、推理、智能体和物理模拟等场景下能力显著提升,且价格保持不变。尽管有测试者吐槽其交互风格有些“神经质”且安全限制收缩,但在盲测排名中,Claude Opus 5依然超越了GPT-5.6等模型,位居所有模型之首。

第 8 集 · Anthropic 大幅精简 Claude Code 系统提示词(2026-07-25,4 条)

Anthropic 对面向 Claude 5 的 Claude Code 上下文工程进行了重大调整,将系统提示词大幅删减了 80%,并新增了 /doctor 审计命令。实践表明,精简提示词后 Claude 5 反而更好用,这也引发了开发者社区关于如何进一步优化 CLAUDE.md 配置的讨论。

第 9 集 · Claude Opus 5 被指刷榜优化,实测仍落后(2026-07-25,2 条)

Claude Opus 5 在 LiveBench 基准测试中的表现引发争议。尽管其分数已逼近 Sol 6 和 Fable 5 等前排模型,但多方观点指出,该模型在与 Sol、Kimi K3 等竞品较量时存在明显的“刷榜式优化”现象。在实际的真实场景测试中,Opus 5 的整体表现依然落后于 Fable 5。

第 10 集 · Claude Opus 5 登顶多榜单成新 SOTA(2026-07-25,6 条)

Claude Opus 5 在最新曝光的多个第三方基准测试榜单中表现出色,综合能力登顶成为新的全局 SOTA(当前最优模型)。在 Artificial Analysis 和 BenchmarkList 的评测中,它均超越了 Claude Fable 5 等竞品,引发了社区的广泛关注。

已确认

根据 Artificial Analysis 更新的榜单,Claude Opus 5 在 Intelligence Index 上获得了 61 分,综合排名第一,略高于 Claude Fable 5。不过,@Hesamation 指出在编程代理(Coding Agent)细分能力上,Fable 5 依然保持领先。此外,@davidthesong 提供的 BenchmarkList 截图显示,Claude Opus 5 被标记为新的全局 SOTA 第 1 名,其覆盖了 52 个基准,实验性 ECI 评分为 154.80。

为什么重要

Claude Opus 5 在综合智能指数上的登顶,标志着大模型能力天花板的再次提升。同时,Opus 5 与 Fable 5 在通用能力与编程代理任务上的差异化表现,为开发者在不同应用场景下的模型选择提供了明确的参考依据。

第 11 集 · Claude Opus 5 刷新 ARC-AGI-3 纪录并展现代数推理(2026-07-25,7 条)

Claude Opus 5 在极具挑战性的 ARC-AGI-3 测试中取得 30.2% 的得分,大幅刷新纪录,成为该基准的新 SOTA。测试中它展现出了一种前所未有的高级逻辑推理能力,标志着前沿模型在抽象推理基准上的显著提升。

已确认

根据 ARC Prize 官方信息,Claude Opus 5 在 ARC-AGI-3 公开演示(Public Demo)环境中的得分为 30.2%,成为该基准的新 SOTA。作为对比,此前的最高分由 GPT-5.6 Sol (Max) 保持,仅为 7.8%。此外,截至 3 月份,所有前沿模型在该测试中的得分均不到 1%,而人类能够解出 100% 的环境。Anthropic 的 Fable-class 模型在同一测试中的得分约为 20%。

在能力表现方面,ARC Prize 官方在分析中发现,Claude Opus 5 展现出了一种此前在前沿模型中从未见过的新能力:在挑战该测试时,它能够自发地将测试布局转化为代数符号进行高级逻辑推理。

为什么重要

ARC-AGI-3 被设计得非常“残酷”,前沿模型长期在此表现不佳。Claude Opus 5 不仅在分数上实现了跨越式增长(从不到 10% 跃升至 30% 以上),其自发使用代数符号进行推理的现象,也为观察大模型的认知与抽象推理演进提供了全新的视角。

第 12 集 · Opus 5 测试现反直觉现象:中等推理性能最佳(2026-07-25,10 条)

FrontierCode 1.1 基准测试的最新数据显示,Claude Opus 5 在中等推理模式下表现最佳,而在极高或最大推理强度下性能反而下降,存在明显的“想太多”现象。这一反直觉的结论为开发者的日常使用提供了直接的指导。

已确认

根据 FrontierCode 1.1 的测试数据,Claude Opus 5 在主集和扩展集上的表现并不随推理强度的增加而单调上升。@dejavucoder 和 @zainhas 指出,开启“中等思考”模式是 Opus 5 的最佳状态,编码性能远超其他设置。相反,当开启“极高思考”或“最大推理”档位时,模型性能出现退步,得分降至与“低思考”模式相近的水平。@keunwoochoi 根据系统卡粗略统计,大约有 20% 到 30% 的报告基准出现了这种开更多思考反而导致性能下降的现象。整体而言,Opus 5 表现优秀,接近榜单领先的 Fable 5,但价格依然维持在 Opus 档位。

尚未确认

关于模型在更高推理强度下性能下降的根本原因,目前主要停留在现象观察与推测阶段。@silasalberti 提供了一种解释机制:FrontierCode 评估的不仅是正确率,还包括代码的“可合并性”,该基准中的 scope 指标可能会对 Opus 5 产生惩罚。另外,@draginol 提出这可能与评测机制有关:Opus 5 在高强度任务下更多依赖子代理分担任务,而子代理通常并非 Opus 5 本身,这可能导致整体评测成绩被拉低。这些解释均未得到官方技术证实。

为什么重要

这一测试结果对开发者的实际调用具有直接的指导意义。@brandon_galang 和 @zainhas 等作者认为,考虑到性能与成本的平衡,将“中等推理档”作为 Opus 5 的默认使用状态是最合理的选择,盲目调高思考预算不仅浪费算力,反而可能弄巧成拙导致模型编码能力下降。

第 13 集 · Claude Opus 5 视觉评测落后且成本高昂(2026-07-25,4 条)

在 EyeBench-V3 基准测试中,Claude Opus 5 虽然超越了同门的 Fable 5 成为 Anthropic 表现最好的模型,但整体性能依然落后于 GPT 和 Gemini。成本方面,尽管 Opus 5 的运行成本比 Fable 5 低约 14%,但其输出极为冗长,生成的 Token 数量约为后者 2.5 倍,导致单任务成本逼近 GPT 5.6 Sol 的两倍。

第 14 集 · Claude Opus 5 提供五档推理强度并默认开启(2026-07-25,2 条)

Claude Opus 5 采用了全新的设计理念,被描述为“一个端点背后包含 5 个模型”,提供 low 到 max 共五档推理强度。开发者需注意的迁移陷阱是,该模型默认开启推理功能,且当选择 xhigh 或 max 档位时,系统将强制开启思考模式,若试图关闭则会直接触发 API 错误。

第 15 集 · Opus 5早期体验:速度快但推理激进且啰嗦(2026-07-25,2 条)

近期早期体验者对Opus 5的评价呈现两面性。一方面,该模型运行速度极快且整体表现不错;另一方面,其在高推理档位下表现得过于积极主动,甚至出现明显的“过度思考”现象。这导致模型输出变得十分啰嗦并消耗大量token,迫使部分用户不得不将默认的高推理档位下调至中等模式以获得更好的平衡。

第 16 集 · Claude Opus 5 在 3D 物理场景测试中胜出(2026-07-25,2 条)

在近期的一项高难度 3D 编码与物理场景对比测试中,Claude Opus 5 展现出了卓越的能力。测试要求四个模型生成带有真实物理效果的自包含 HTML 场景,结果显示 Claude Opus 5 成胜出,且其完成成本仅为 1.40 美元,约为其他对比模型费用的四分之三。这表明该模型在复杂的前端与物理引擎编码任务上兼具性能与性价比优势。

第 17 集 · Claude Opus 5 登顶 OSWorld v2(2026-07-25,2 条)

在最新发布的 OSWorld v2 计算机使用评测中,Claude Opus 5 的成绩从 55.7% 大幅跃升至 70.6% 并成功登顶。面对现有基准已难以衡量顶尖模型能力的现状,开发者感叹智能体评测追赶正在加速,并悬赏呼吁业界构建更难的测试基准。