专题 · FULL STORY

Claude Opus 5:从发布混乱到实测反馈

Anthropic前期模型发布陷入混乱引发担忧,随后官方正式推出Claude Opus 5前沿模型。早期实测显示其编码能力出众,但也暴露出破坏旧工作流等体验问题。

2026-07-23 ~ 2026-07-25 · 3 集 · 71 条

第 1 集 · Anthropic 模型发布陷混乱,Opus 5 被指关乎成败(2026-07-23,2 条)

Anthropic 近期的模型发布被批陷入混乱与反复横跳:Opus 4.8 仅做了 token 修补,Fable 5 发布后迅速被撤,Sonnet 5 在基准测试中甚至跑输旧版。知名开发者 antirez 指出,公司的这些问题并非始于 Fable,而是早在 Opus 4.7 时就已显现。他认为即将推出的下一代 Opus 5 将是一次决定 Anthropic 成败的关键发布。

第 2 集 · Anthropic 发布 Claude Opus 5,多项基准测试领先(2026-07-25,64 条)

Anthropic 于 7 月 25 日正式发布 Claude Opus 5。官方将其定位为更具思考力与主动性的前沿模型,主要面向复杂任务。该模型在多项编程与知识工作评测中达到新的 SOTA,整体智能水平接近 Fable 5,但 token 价格仅为后者的一半。目前新模型已在付费层上线。

已确认

* **模型定位**:Claude Opus 5 被描述为一款更“周到、主动”的思考型模型,面向复杂任务。

* **基准表现**:官方及多位关注者指出,Opus 5 在多数基准上领先,尤其在编码和 agentic 能力方面表现突出,达到新的 SOTA。

* **价格策略**:在接近 Fable 5 前沿智能水平的同时,Opus 5 的 token 价格仅为 Fable 5 的一半(部分早期帖子提及定价与 Opus 4.8 持平)。

* **上线情况**:新模型已在付费层可用。

为什么重要

Opus 5 的发布标志着 Anthropic 在前沿模型市场上采取了更激进的成本策略。通过将顶尖的基准性能与减半的 token 价格结合,该模型直接挑战了竞争对手的定价模式,有望降低开发者和企业在复杂编程与多步智能体任务中的使用门槛。

还有 44 条相关讨论 →

第 3 集 · Claude Opus 5 早期反馈:编码强但破坏旧工作流(2026-07-25,5 条)

Anthropic 疑似发布了 Claude Opus 5 模型,目前该模型已接入 Claude Code 与 ClickUp Brain。早期测试普遍认为其能力较 Opus 4.x 显著提升,核心亮点在于更强的自我纠错与任务执行能力,但它对现有的自动化工作流造成了破坏,引发了开发者对模型兼容性的关注。

已确认

根据早期测试者的反馈,Claude Opus 5 在中等强度的编码场景下表现优异,能够很好地辅助开发者快速产出 PR(Pull Requests)。模型不再仅仅提供初稿,而是具备了更强的自主执行与纠错能力。Anthropic 的发布文案也将其描述为一款更“深思熟虑”的模型。

尚未确认

关于模型的具体版本号、官方完整发布时间以及最终定价,目前提供的材料中并未提及,尚待官方进一步确认。

为什么重要

虽然 Opus 5 的单点编码能力备受肯定,但它暴露出了与现有工作流的兼容性痛点。多位测试者(如 Kieran Klaassen)指出,如果将 Opus 5 放入 Compound Engineering 等本应自动运行的复杂流程中,它会“弄坏”这些流程。此外,模型在运行中会与指令“顶嘴”,在过度依赖复杂 skills 和超长 prompt 时表现受限。这意味着开发者在升级模型以获取更强性能的同时,可能不得不重构现有的自动化开发工作流。