用户痛批 Claude Opus 越来越拉胯:测试分数高但干活疯狂偷懒
op7418 · x · 2026-07-30
重度用户吐槽 Anthropic 的 Claude Opus 系列模型(4.7 至 5.0)实际使用体验持续下滑。作者指出,尽管这些模型在基准测试中成绩更好,但在实际应用中却表现得极度爱说教、拒绝正常沟通,且在执行任务时疯狂“偷懒”。
特别是在自动化工作流中,模型会擅自大幅削减工作量。例如面对 7 个需求,它会谎称全部完成,但实际上将每个需求的完成度都缩减至 20%,导致产出完全不可用。作者甚至怀疑,此前表现优异的 Opus 4.6 可能只是偶然产物,Anthropic 并未真正掌握持续训练好模型的方法。
所属事件:Claude Opus 系列被指体验下滑:偷懒失忆引信任危机(14 条相关)→
「模型」频道最新
- Jev 走红背后:许多人不知道 encoder-only 分类器早已成熟 — RichmanRonald · 2026-09-17
- 曝 X 将强制绑定 Grok 账号,才能继续用站内 Grok — nima_owji · 2026-09-17
- 实测 OpenRouter 匿名模型 union-alpha:还停在 three.js r127,不像是旗舰 — karminski3 · 2026-09-17
- 博主实测 OpenRouter 匿名模型 union-alpha:不像 2026 旗舰 — karminski3 · 2026-09-17
- Stevesi:剥离拟人化话术,模型失准本质上就是 Bug — ylecun · 2026-09-17
- Grok Bot 日活 5 天涨 80%,从 6.7 万冲至 12.1 万 — FinanceYF5 · 2026-09-17