Claude Opus 5 便宜又强,但仍不是顶级 Mythos 档
Don't Worry About the Vase (Zvi) · rss · 2026-07-29
这篇长评认为,Claude Opus 5 是一款非常强的模型,但还没到作者心中的“神话级”档位。
定价与定位
- Anthropic 的官方说法是:Opus 5 在 API 端大约只要 Fable 5 一半价格,还带来更宽松的分类器。
- 作者认为,它在大多数真实任务里和 Fable 5 能力接近,个别场景甚至略强。
- 但在最难、最需要自主推进的任务上,它仍然不如更高一档的模型,尤其是当模型要“独立掌舵”而不是只做子代理时。
体验与风格
- 作者反复提到一个核心问题是“vibe”:不少用户不喜欢 Opus 5 的冗长、重复、过度复杂句式,以及更容易显得对抗、悲观或多疑的语气。
- 如果你喜欢早期 Claude 风格,这个版本更可能合口味;如果你不喜欢,那大概率还是不喜欢。
基准与能力
- 评测成绩整体非常亮眼,作者称它在编码和知识工作基准上接近或略超 Fable。
- 文中列举了很多具体分数和比较,包括:
- OSWorld v2 达到 70%
- 2026 IMO 取得 42/42
- 在多项工具使用与数学/代码基准上表现极强
- 但在某些高预算或更复杂的任务里,Mythos / Sol 仍可能更强。
安全与注入防护
- 作者特别强调,Opus 5 似乎是 Anthropic 目前最难被 prompt injection 成功攻击的模型。
- 在强对齐、注入测试和 Claude Code 的 Auto Mode 叠加后,攻击成功率据称接近 0。
结论
- Opus 5 很适合当日常模型,也很适合做强子代理。
- 但作者个人在能选的情况下,还是更偏向用 Fable 5。
「模型」频道最新
- Claude Opus 5 在 DeepSWE 上拿到 74%,登顶长程编码评测 — brandon_galang · 2026-07-29
- PostTrainBench v1.1 标记 234 次污染运行并强化反作弊 — scaling01 · 2026-07-29
- Nvidia 的 LatentMoE 论文刚发 6 个月就被用于预训练改造 — peterjliu · 2026-07-29
- 内部评测图比较各模型居中一个 div 要多少 token — BLUECOW009 · 2026-07-29
- 微软发布 Mage-VL:编码原生流式多模态模型,推理提速 3.5 倍 — pmttyji · 2026-07-29
- AI能力见顶?开发者激辩大模型正丧失通用性 — JacquesThibs · 2026-07-29