专题 · FULL STORY
Claude Opus 5:从发布混乱到实测反馈
Anthropic前期模型发布陷入混乱引发担忧,随后官方正式推出Claude Opus 5前沿模型。早期实测显示其编码能力出众,但也暴露出破坏旧工作流等体验问题。
2026-07-23 ~ 2026-07-25 · 3 集 · 71 条
第 1 集 · Anthropic 模型发布陷混乱,Opus 5 被指关乎成败(2026-07-23,2 条)
Anthropic 近期的模型发布被批陷入混乱与反复横跳:Opus 4.8 仅做了 token 修补,Fable 5 发布后迅速被撤,Sonnet 5 在基准测试中甚至跑输旧版。知名开发者 antirez 指出,公司的这些问题并非始于 Fable,而是早在 Opus 4.7 时就已显现。他认为即将推出的下一代 Opus 5 将是一次决定 Anthropic 成败的关键发布。
- Anthropic 近几个月发布混乱:Fable 5 被撤、Sonnet 5 跑输旧版 — haider1 · 2026-07-23
- antirez 称 Opus 5 将决定 Anthropic 成败 — antirez · 2026-07-24
第 2 集 · Anthropic 发布 Claude Opus 5,多项基准测试领先(2026-07-25,64 条)
Anthropic 于 7 月 25 日正式发布 Claude Opus 5。官方将其定位为更具思考力与主动性的前沿模型,主要面向复杂任务。该模型在多项编程与知识工作评测中达到新的 SOTA,整体智能水平接近 Fable 5,但 token 价格仅为后者的一半。目前新模型已在付费层上线。
已确认
* **模型定位**:Claude Opus 5 被描述为一款更“周到、主动”的思考型模型,面向复杂任务。
* **基准表现**:官方及多位关注者指出,Opus 5 在多数基准上领先,尤其在编码和 agentic 能力方面表现突出,达到新的 SOTA。
* **价格策略**:在接近 Fable 5 前沿智能水平的同时,Opus 5 的 token 价格仅为 Fable 5 的一半(部分早期帖子提及定价与 Opus 4.8 持平)。
* **上线情况**:新模型已在付费层可用。
为什么重要
Opus 5 的发布标志着 Anthropic 在前沿模型市场上采取了更激进的成本策略。通过将顶尖的基准性能与减半的 token 价格结合,该模型直接挑战了竞争对手的定价模式,有望降低开发者和企业在复杂编程与多步智能体任务中的使用门槛。
- Reddit 转发 Anthropic 的 Claude Opus 5 官方发布页 — CucumberAccording813 · 2026-07-25
- Anthropic 发布 Claude Opus 5,称能力逼近前沿且价格减半 — claudeai · 2026-07-25
- Anthropic 称 Claude Opus 5 在编码和知识工作评测上已达 SOTA — claudeai · 2026-07-25
- Anthropic 称 Claude Opus 5 以更低任务成本领先对手 — claudeai · 2026-07-25
- Claude Opus 5 在 ARC-AGI-3 评测中得分超次优模型三倍 — claudeai · 2026-07-25
- Anthropic 称 Claude Opus 5 经行为审计后是最对齐的模型 — claudeai · 2026-07-25
- Claude Opus 5 在 ARC-AGI-3 上得分达到第二名的三倍 — claudeai · 2026-07-25
- Anthropic 官宣 Opus 5 定价与安全护栏:主打网络安全场景 — claudeai · 2026-07-25
- Anthropic 发布 Claude Opus 5:编码更强,对齐更好,价格不变 — ClaudeOfficial · 2026-07-25
- Anthropic 推出 Claude Opus 5,价格仅为 Fable 5 一半 — thesaraharminta · 2026-07-25
- 基准图表显示 Claude Opus 5 在编程、搜索和生物任务领先 — legit_api · 2026-07-25
- Frontier-Bench 图表对比 Claude Opus 5、Fable 5 和 GPT-5.6 Sol 编程表现 — thesaraharminta · 2026-07-25
- Anthropic 图表显示 Claude Opus 5 多项编程与知识评测领先 — Acceptable-Debt-294 · 2026-07-25
- Opus 5 ARC-AGI-3 达到 30.2%,多项代理基准领先 — socoolandawesome · 2026-07-25
- Anthropic 周五预告指向 Claude Opus 5,价格是 Fable 5 一半 — MeetPatelTech · 2026-07-25
- Anthropic 发布 Claude Opus 5 系统卡 — tokenbender · 2026-07-25
- Anthropic 图表显示 Claude Opus 5 在 ARC-AGI-3 上得分 30.2% — Progressbarist · 2026-07-25
- Claude Opus 5 多数基准领先 Fable 5,价格却只有一半 — Yuchenj_UW · 2026-07-25
- Claude 推出 Opus 5,称前沿智能只要半价 — daniel_mac8 · 2026-07-25
- Opus 5 传出 ARC-AGI-3 达到 30.2% — manubfr · 2026-07-25
第 3 集 · Claude Opus 5 早期反馈:编码强但破坏旧工作流(2026-07-25,5 条)
Anthropic 疑似发布了 Claude Opus 5 模型,目前该模型已接入 Claude Code 与 ClickUp Brain。早期测试普遍认为其能力较 Opus 4.x 显著提升,核心亮点在于更强的自我纠错与任务执行能力,但它对现有的自动化工作流造成了破坏,引发了开发者对模型兼容性的关注。
已确认
根据早期测试者的反馈,Claude Opus 5 在中等强度的编码场景下表现优异,能够很好地辅助开发者快速产出 PR(Pull Requests)。模型不再仅仅提供初稿,而是具备了更强的自主执行与纠错能力。Anthropic 的发布文案也将其描述为一款更“深思熟虑”的模型。
尚未确认
关于模型的具体版本号、官方完整发布时间以及最终定价,目前提供的材料中并未提及,尚待官方进一步确认。
为什么重要
虽然 Opus 5 的单点编码能力备受肯定,但它暴露出了与现有工作流的兼容性痛点。多位测试者(如 Kieran Klaassen)指出,如果将 Opus 5 放入 Compound Engineering 等本应自动运行的复杂流程中,它会“弄坏”这些流程。此外,模型在运行中会与指令“顶嘴”,在过度依赖复杂 skills 和超长 prompt 时表现受限。这意味着开发者在升级模型以获取更强性能的同时,可能不得不重构现有的自动化开发工作流。
- 早期测试称 Claude Opus 5 很强,但会打破旧工作流 — every · 2026-07-25
- Opus 5 编码体验不错,却把自主 Compound Engineering 流程弄坏了 — danshipper · 2026-07-25
- 早期反馈称 Claude Opus 5 在 Claude Code 里更利于快速产出 PR — EricBuess · 2026-07-25
- Claude Opus 5 编程好用,但把 Compound Engineering 搞坏了 — danshipper · 2026-07-25
- Claude Opus 5 疑似曝光:具备自我纠错与执行能力 — mathemagic1an · 2026-07-25