Opus 5 实测:单 prompt 生成惊艳,复杂任务仍逊 Fable
Claude Opus 5 发布短短数日便在开发者社区引发实测热潮。该模型在单次提示词生成复杂应用方面表现惊艳,常识理解与指令跟随能力获好评;但在复杂长程任务中,多位深度测试者认为其稳定性和思考深度仍逊色于 Fable。这揭示了前沿 AI 模型在“刷榜”与“真实可用性”之间日益扩大的脱节现象。
已确认
综合多位用户的试用反馈,Opus 5 在实际任务中展现出以下明确特点:
- 单 prompt 生成能力强:@eyishazyer 展示了多个案例,Opus 5 仅凭一条提示词就做出了完整的第一人称射击游戏、滑雪板物理模拟,甚至复刻了带方块物理和实时光照的 Minecraft,还能在几分钟内生成咨询公司级别的表格与演示文稿。@eyishazyer 还指出 Opus 5 整体能力强于 Opus 4.8,但继承了 Fable 的一些风格特征。此外,@bdsqlsz 提到已有开发者使用 Opus 5 改进代码并公开,效果获得明显提升。
- 场景分工与实战体验:@drcintas 总结了使用策略,建议将 Sonnet 5 用于日常编码和草稿,Opus 5 用于复杂 agent 任务。@dejavucoder 表示在实际使用中更倾向于 Opus 5 的中高档设置,大幅降低了 Sonnet 5 的使用频率。
- 常识与指令跟随强:@dejavucoder 与 @JasonBotterill 均指出,Opus 5 能更好地理解用户意图,相比之下 GPT-5.6 Sol 在指令遵循上显得较为死板。@iskander 认为 Opus 5 像天生的子代理,技术能干且审美不错。
尚未确认
- 复杂任务表现争议:尽管 Opus 5 在基准测试中占优,但 @petergyang 和 @doodlestein 指出其在真实复杂任务里明显落后于 Fable,即便排除上下文退化因素结论依然如此。@antirez 实测两天后认为 Opus 5 追平了差距但未实现反超。@Veraticus 和 @iskander 也提到,它在长程协作和高层创意发散上偏僵硬。@johnlindquist 也认同在开放式编码中 Fable 表现更好。
- 非思考模式对比:关于非思考模式的 Opus 5 与思考模式的 Sonnet 5 之间的性能对比,目前主要基于 @dejavucoder 和 @JasonBotterill 等人的主观推测与个人体验,尚未经过系统性 benchmark 测试,官方也未将其作为重点展示。
为什么重要
这些深度实测揭示了前沿 AI 模型在“刷榜”与“真实可用性”之间日益扩大的脱节现象。Opus 5 展现出的强大底座理解力与单次生成能力为开发者提供了极高效率,但在长周期复杂任务中的局限性也为模型选型提供了务实的参考。
2026-07-26 ~ 2026-07-28 · 24 条相关
- 第 1 集:Anthropic 模型发布陷混乱,Opus 5 被指关乎成败(2026-07-23,2 条)
- 第 2 集:Anthropic 发布 Claude Opus 5:性能达 SOTA 且价格减半(2026-07-25,128 条)
- 第 3 集:网传 Anthropic 发布 Opus 5,支持加速与科研顶配(2026-07-25,3 条)
- 第 4 集:Claude Opus 5 早期实测:效率提升但行为过度主动(2026-07-25,29 条)
- 第 5 集:Anthropic发布Claude Opus 5实测表现亮眼(2026-07-25,3 条)
- 第 6 集:Claude Opus 5 被指刷榜优化,实测仍落后(2026-07-25,2 条)
- 第 7 集:Claude Opus 5 创下 ARC-AGI-3 新纪录(2026-07-25,15 条)
- 第 8 集:Anthropic 内部材料曝光 Opus 5 研发进展(2026-07-25,2 条)
- 第 9 集:Opus 5 实测:单 prompt 生成惊艳,复杂任务仍逊 Fable(2026-07-26,24 条)
- 第 10 集:Claude Opus 5 发布并重写提示习惯(2026-07-27,11 条)
- 第 11 集:Anthropic Opus 5 基准领先但实战口碑分裂(2026-07-28,6 条)
- 第 12 集:Claude Opus 系列被指体验下滑:偷懒失忆引信任危机(2026-07-29,14 条)
- 第 13 集:Anthropic 发布 Claude Opus 5:性能比肩旗舰且成本减半(2026-07-31,2 条)
- 第 14 集:Anthropic 新版模型体验下滑引发开发者信任危机(2026-08-03,11 条)
一手来源
- Opus 5 发布三天,已经掀起一波实测潮 — eyishazyer ·
- 用户称 Opus 5 在复杂任务上已落后 Fable — doodlestein ·
- Opus 5 基准分更高,真实使用却明显落后 Fable — petergyang ·
- Anthropic 用户总结:Opus 5 适合复杂 agent,Sonnet 5 适合日常编码 — dr_cintas · 2026-07-26
- 开发者实测 24 小时:Fable 5 在开放式编码更强 — johnlindquist · 2026-07-26
- 【源头】Opus 5 基准分更高,真实使用却明显落后 Fable — petergyang · 2026-07-26
- Claude Opus 5 上线不足 24 小时就引爆早期实作 — Aiden_Tech_Ai · 2026-07-26
- Opus 5 被称 3D 表现惊艳,但并非全能更强 — TAbrodi · 2026-07-26
- antirez 实测两天:Opus 5 追上差距但仍未胜出 — antirez · 2026-07-26
- 用户称 Claude Opus 5 比 GPT-5.6 Sol 更有常识感 — dejavucoder · 2026-07-26
- Botterill 说 Opus 5 在指令跟随上更有常识 — JasonBotterill · 2026-07-26
- Jason Botterill 认为非思考版 Opus 5 可能更强 — JasonBotterill · 2026-07-26
- 用户称 Opus 5 在实战里压过 Sonnet 5 — dejavucoder · 2026-07-26
- 用 Opus 5 改出来的代码已公开,效果明显提升 — bdsqlsz · 2026-07-27
- Reddit 用户称 Opus 5 编码更强,但更难驾驭 — Veraticus · 2026-07-27
- 【源头】用户称 Opus 5 在复杂任务上已落后 Fable — doodlestein · 2026-07-27
- 实测对比:Opus 5 复杂任务易出错,Fable 思考更深表现更稳 — doodlestein · 2026-07-27
- 硬调试里反复返工,Opus 可能比 Fable 更贵 — doodlestein · 2026-07-27
- Claude Opus 5 被评价为强子代理,但高层创意仍偏僵硬 — iskander · 2026-07-27
- 【源头】Opus 5 发布三天,已经掀起一波实测潮 — eyishazyer · 2026-07-27
- 发布三天后,Opus 5 已能做咨询级表格和幻灯片 — eyishazyer · 2026-07-27
- Opus 5 复刻 Minecraft,带方块物理和实时光照 — eyishazyer · 2026-07-27
- Opus 5 一条提示做出雪板模拟,物理效果到位 — eyishazyer · 2026-07-27
- Opus 5 仅凭一个提示词做出完整射击游戏 — eyishazyer · 2026-07-27
- Opus 5 整体强于 4.8,但也带上了 Fable 风格 — eyishazyer · 2026-07-27
- 用户反馈 Opus 5 更易翻车,Opus 4.8 仍然更稳 — omarsar0 · 2026-07-28
另有 1 条近重复转述:eyishazyer