博主吐槽 Claude 评测很好用起来诡异,疑后训练引入怪癖
MaziyarPanahi · x · 2026-09-14
一位开发者在长文中吐槽 Claude Opus 5 等新模型「评测成绩很好,但实际使用体验诡异」:模型总在过度行事——读文件、干活、反复检查,像需要「保姆式看护」。他引用 Dwarkesh 播客约 23:25 处的观点,有人认为 Sonnet/Opus 的实际表现不如 GLM 和 Kimi,并怀疑 Anthropic 在后训练中「把怪癖训练了进去」,而这种问题往往不会体现在 benchmark 上。
所属事件:开发者质疑 Claude 评测亮眼却暗藏怪癖(2 条相关)→
「模型」频道最新
- Sebastian Raschka 上线 LLM 架构画廊,103 个模型架构一页对比 — zainhas · 2026-09-14
- Plus 付费用户怒斥 OpenAI:3 条消息烧掉 77% 的 5 小时额度 — razzlesama · 2026-09-14
- 为什么生产环境几乎没人用<50M参数的微型专用模型? — Guna1260 · 2026-09-14
- 开发者吐槽 Claude Opus 5 本周又变笨了 — draginol · 2026-09-14
- 79K 参数小模型实测 RLT:能学状态追踪但长序列泛化差 — mike64_t · 2026-09-14
- 智谱融资 50 亿美元,六成投向下一代 GLM 与"自训练"递归循环 — teortaxesTex · 2026-09-14