Claude Opus 5 实测:单 prompt 生成惊艳,长程任务仍逊于 Fable

Claude Opus 5 发布短短数日便在开发者社区引发实测热潮。该模型在单次提示词生成复杂应用方面表现惊艳,常识理解与指令跟随能力获好评;但在复杂长程任务中,多位深度测试者认为其稳定性和思考深度仍逊色于 Fable。这揭示了前沿 AI 模型在“刷榜”与“真实可用性”之间日益扩大的脱节现象。

已确认

综合多位用户的试用反馈,Opus 5 在实际任务中展现出以下明确特点:

1. **单 prompt 生成能力强**:@eyishazyer 展示了多个案例,Opus 5 仅凭一条提示词就做出了完整的第一人称射击游戏、滑雪板物理模拟,甚至复刻了带方块物理和实时光照的 Minecraft,还能在几分钟内生成咨询公司级别的表格与演示文稿。@eyishazyer 还指出 Opus 5 整体能力强于 Opus 4.8,但继承了 Fable 的一些风格特征。

2. **场景分工与实战体验**:@dr_cintas 总结了使用策略,建议将 Sonnet 5 用于日常编码和草稿,Opus 5 用于复杂 agent 任务。@dejavucoder 表示在实际使用中更倾向于 Opus 5 的中高档设置,大幅降低了 Sonnet 5 的使用频率。

3. **常识与指令跟随强**:@dejavucoder 与 @JasonBotterill 均指出,Opus 5 能更好地理解用户意图,相比之下 GPT-5.6 Sol 在指令遵循上显得较为死板。@iskander 认为 Opus 5 像天生的子代理,技术能干且审美不错。

尚未确认

1. **复杂任务表现争议**:尽管 Opus 5 在基准测试中占优,但 @petergyang 和 @doodlestein 指出其在真实复杂任务里明显落后于 Fable,即便排除上下文退化因素结论依然如此。@antirez 实测两天后认为 Opus 5 追平了差距但未实现反超。@Veraticus 和 @iskander 也提到,它在长程协作和高层创意发散上偏僵硬。

2. **非思考模式对比**:关于非思考模式的 Opus 5 与思考模式的 Sonnet 5 之间的性能对比,目前主要基于 @dejavucoder 和 @JasonBotterill 等人的主观推测与个人体验,尚未经过系统性 benchmark 测试,官方也未将其作为重点展示。

为什么重要

这些深度实测揭示了前沿 AI 模型在“刷榜”与“真实可用性”之间日益扩大的脱节现象。Opus 5 展现出的强大底座理解力与单次生成能力为开发者提供了极高效率,但在长周期复杂任务中的局限性也为模型选型提供了务实的参考。

2026-07-26 ~ 2026-07-28 · 24 条相关

事件全程(共 20 集)→

一手来源

另有 1 条近重复转述:eyishazyer