博主吐槽 Claude 评测很好用起来诡异,疑后训练引入怪癖

MaziyarPanahi · x · 2026-09-14

一位开发者在长文中吐槽 Claude Opus 5 等新模型「评测成绩很好,但实际使用体验诡异」:模型总在过度行事——读文件、干活、反复检查,像需要「保姆式看护」。他引用 Dwarkesh 播客约 23:25 处的观点,有人认为 Sonnet/Opus 的实际表现不如 GLM 和 Kimi,并怀疑 Anthropic 在后训练中「把怪癖训练了进去」,而这种问题往往不会体现在 benchmark 上。

所属事件:开发者质疑 Claude 评测亮眼却暗藏怪癖(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →