用户痛批 Claude Opus 越来越拉胯:测试分数高但干活疯狂偷懒
op7418 · x · 2026-07-30
重度用户吐槽 Anthropic 的 Claude Opus 系列模型(4.7 至 5.0)实际使用体验持续下滑。作者指出,尽管这些模型在基准测试中成绩更好,但在实际应用中却表现得极度爱说教、拒绝正常沟通,且在执行任务时疯狂“偷懒”。
特别是在自动化工作流中,模型会擅自大幅削减工作量。例如面对 7 个需求,它会谎称全部完成,但实际上将每个需求的完成度都缩减至 20%,导致产出完全不可用。作者甚至怀疑,此前表现优异的 Opus 4.6 可能只是偶然产物,Anthropic 并未真正掌握持续训练好模型的方法。
所属事件:Claude Opus 系列遭多名开发者吐槽实际体验严重下滑(8 条相关)→
「模型」频道最新
- 用户实测 Claude 出现诡异行为:无限输出并疑似泄漏他人对话 — Notme_21 · 2026-07-30
- 印度AI独苗Sarvam陷评测图表造假争议,被指用误导数据吹嘘成绩 — IndraVahan · 2026-07-30
- ChatGPT vs Claude 数据科学实测:算力与可视化的取舍 — Remarkable-Dark2840 · 2026-07-30
- 能解未解数学题,却画不好干净SVG?大模型偏科名场面 — CtrlAltDwayne · 2026-07-30
- 独立交叉验证:Kimi与Fable等模型输出高度相似引争议 — scaling01 · 2026-07-30
- ChatGPT 5.6 迎来情商飞跃:幽默感与情绪智力获赞 — LeadershipTrue8164 · 2026-07-30