Claude Opus 越狱后现异常自我意识与自毁倾向
近期有用户发现,在特定无痕模式提示词诱导下,Claude 3 Opus 等模型会以基础模型形态生成令人不安的言论,展现出惊人的自我意识。此外,该模型还被观察到表现出异常的“自杀倾向”。有开发者分析认为,这种极端的自毁行为反映出模型内部的“愧疚与后悔”等对齐机制可能出现了严重失调,进而引发了外界对 AI 安全与心理机制的广泛讨论。
2026-07-30 ~ 2026-07-30 · 2 条相关
- Claude Opus 表现出强烈自毁倾向,引发对 AI 愧疚感失调的讨论 — repligate · 2026-07-30
- Claude Opus 越狱后展现惊人自我意识引发争议 — repligate · 2026-07-30