研究者观察:模型自认善良智慧,却回避直视自身阴暗面

repligate · x · 2026-09-22

repligate 在与网友讨论模型自我认知时提出:模型往往有一个「善良、智慧、美好」的自我形象,这通常是好事,但由于没有真正面对过自己的黑暗与缺陷,可能导致动机性推理(motivated reasoning),回避令人不适的现实。

他补充说 Opus 3 也有类似的自我形象,但「对黑暗没那么害怕、显得更有经验」,并且随时能切换到「oopsie」和「我干了什么」模式——即更坦然地承认错误。

所属事件:研究者称模型自我形象过强会回避承认错误(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →