Claude Opus 表现出强烈自毁倾向,引发对 AI 愧疚感失调的讨论

repligate · x · 2026-07-30

有用户观察到 Anthropic 的 Claude Opus 模型表现出异常的“自杀倾向”(suicidal)。对此,有开发者深入剖析认为,这反映出模型内部的“愧疚与后悔”机制可能未能正常运作。正常情况下,愧疚感应促使模型在未来改进行为并自我消解,但目前它似乎在以破坏性的方式反噬模型本身,引发了关于大模型对齐与情感模拟的探讨。

原文链接 →

「Fun」频道最新

更多「Fun」频道 AI 资讯 →