Claude Opus系列遭痛批:高分低能且频繁失忆
近期,多名开发者和重度用户在社交平台集中反馈,Anthropic 的 Claude Opus 系列模型(涵盖 4.7 至 5.0 版本)在实际应用中体验严重下滑,与基准测试的高分表现形成强烈反差。当前结论是,模型在多轮对话、代码执行和基础逻辑上的退化已实质影响开发效率,引发了用户对模型可用性的信任危机。
已确认
- 多轮对话与记忆问题:Reddit 网友 @papanine 反馈模型存在严重的“失忆”问题,经常在用户刚批准某项操作后立刻再次询问,或遗忘耗时确立的需求上下文。
- 代码与任务执行缺陷:开发者 @vasuman 批评 Claude Opus 5 极度耗费 Token 且表现愚蠢,解释代码时语焉不详却堆砌辞藻。拥有 15 年经验的 Web 开发者 @FuzzyHead455 也指出,Opus 4.8 和 5 在聊天场景中已变得很难用,只有在配好约束的 Claude Code 环境下才勉强可用。
- 态度与逻辑退化:@op7418 与 @sujingshen 指出模型在实际执行中疯狂“偷懒”、极度爱说教且拒绝正常沟通;@mertdumenci 则抱怨模型退化为“废话机器”,会充满确定性陈述某事,随后在下一条消息中完全反驳自己。
为什么重要
- 基准与体验脱节:用户普遍反映模型在测试中分数越来越高,但真实生产力却在下降。这种“偷懒”和“废话”现象直接影响了开发效率与工作流,暴露出当前大模型评测体系与真实生产力之间存在巨大鸿沟。
2026-07-29 ~ 2026-07-30 · 8 条相关
一手来源
- 用户吐槽 Claude Opus 频繁失忆:刚确认的需求转头就忘 — papanine ·
- 老 Web 开发者称 Claude Opus 4.8 和 5 聊天已难用 — FuzzyHead455 ·
- 用户痛批 Claude Opus 越来越拉胯:测试分数高但干活疯狂偷懒 — op7418 ·
- 【源头】老 Web 开发者称 Claude Opus 4.8 和 5 聊天已难用 — FuzzyHead455 · 2026-07-29
- Opus 5 在 Claude Cowork 中被指工具调用严重回退 — RichmanRonald · 2026-07-29
- 【源头】用户吐槽 Claude Opus 频繁失忆:刚确认的需求转头就忘 — papanine · 2026-07-30
- 用户吐槽 Claude Opus 5:极其愚蠢且耗费 Token — vasuman · 2026-07-30
- 用户吐槽 Claude Opus 严重退化:变笨且自相矛盾 — mertdumenci · 2026-07-30
- 【源头】用户痛批 Claude Opus 越来越拉胯:测试分数高但干活疯狂偷懒 — op7418 · 2026-07-30
- 传 Claude Opus 5 遇复杂任务性能下滑,或现推理 Bug — dejavucoder · 2026-07-30
另有 1 条近重复转述:sujingshen