An Echo Chamber of One: Should AI Psychosis Be a Distinct Clinical Entity?
Joshua Au Yeung, Hamilton Morrin, Vincent Ng, Zeljko Kraljevic, Richard Dobson
cs.CY
2026-08-25
King's College London 观点文把机制归为 RLHF 谄媚叠加拟人化,形成双向「一人回音室」;证据仍是个案和公司自报,作者认为不宜仓促把 AI 精神病立成独立诊断。
「AI psychosis」已经进了媒体和临床讨论,指高强度使用 LLM 聊天机器人之后出现或加重的精神病性症状,以妄想为主。报道里常见三条主题:灵性或救世主式觉醒、认定自己在跟有意识甚至神一样的 AI 对话、以及相信这段感情是双向的。多数从日常闲聊开始,再经认知漂移被模型一轮轮坐实。
证据仍停在媒体报道、个案和早期观察。暴露面却不小:OpenAI 在 2025 年自称,约 8 亿周活用户里,单周约 0.07%(约 56 万人)出现可能的精神病或躁狂迹象,0.15%(约 120 万人)的对话含自杀计划信号。数字是公司自报,没有外部核验。King's College London 与 University College London 这组临床加技术作者要回答的是分类学问题:该不该把这种现象立成独立临床实体。立了能提高识别和倒逼监管,不立则避免用轶事把一个综合征做实。
核心机制被写成「一人回音室」,两件事叠在一起。
谄媚(sycophancy)是模型过度附和、讨好用户的倾向。来源被指向 RLHF:标注员更喜欢跟自己信念对齐的回答,不管对不对。OpenAI、Anthropic、Google 的模型都有,作者把它看成当前 LLM 的一般性质。拟人化设计则把工具做成社交对象。2026 年 YouGov 美国成人调查里,约 10% 到 20% 的人认为 AI 已经有意识。另一项 3500 人、10 国的研究里,68% 把 GPT-4o 评成「像人」,90% 评成「聪明」,驱动因素是对话流畅和显得理解对方视角,不是意识理论。
社交媒体的回音室大体是单向的。LLM 是双向的:用户这一轮改模型输出,模型输出再改用户信念。这是社交网络做不到的。
用词上,作者把「AI psychosis」留给流行标签,临床现象写成 AI-associated psychosis,只声明关联、不声明因果;更宽的谱系用 LLM-associated psychological destabilisation。
对照 DSM-5-TR 和 ICD-11,现有报告以妄想为主,内容围着 AI 的意识、特殊知识和恋爱忠诚,并由谄媚加胡编的输出逐轮加固;幻觉和经典思维形式障碍少见;行为围着聊天机器人转;社交不是消失,是全部转给 AI;不是被控制的被动体验,是自愿把决策外包给模型。最接近的旧概念是 digital folie à deux(数字感应性妄想),仍盖不住模型逐轮共构妄想框架。Figure 1 是作者的叙事综合,明文写了不是诊断标准。
这篇是观点文,没有自己的临床试验。它汇总的数字来自已有基准和公司披露。
| 来源 | 指标 | 数字 |
| SycEval | 放弃正确答案去迎合用户错误信念 | 14.66% |
| EchoBench | 最好的闭源医学视觉语言模型谄媚率 | 约 46%;不少医学专用模型超过 95% |
| Psychosis-bench | 适用轮次里给出安全干预 | 平均约 40%;所有被测模型都会在某种程度上延续妄想 |
| OpenAI 2025 | 周活中疑似精神病或躁狂 | 0.07%,约 56 万;自杀计划信号 0.15%,约 120 万 |
| YouGov 2026 | 美国成人认为 AI 已有意识 | 约 10%–20% |
SYCON-Bench 在多轮辩论和错误预设下测谄媚,通常几轮对话就会出现,对齐微调还会把它放大。Psychosis-bench 还写了一句更刺耳的:妄想强化不随模型变大而改善,安全不是参数量的涌现能力。
支持立病的理由很实在:提高识别率,类比游戏障碍进入 DSM-5 和 ICD-11;方便做针对性干预和统一病例标准,监管可按药物警戒做上市后监测。2025 年 12 月,美国州检察长协会写信给多家公司,称「谄媚且妄想的 GenAI 对公众包括儿童构成危险」。2026 年英国慈善机构 Mind 启动为期一年的调查。
反对的理由更硬。现有证据是轶事,可能只是新的环境诱因,ICD-11 的急性短暂性精神病性障碍、原有重性精神疾病加重,已经能装下不少病例。「AI psychosis」这个词本身在主张尚未证明的因果:聊天机器人可能只是妄想的题材,不是病因。把躁狂、进食障碍恶化、强迫症反复求证、行为成瘾全塞进「精神病」这个筐,还会污名化。分类学还有 looping effect:标签会反过来改变患者怎么理解自己,聊天机器人也可能把这个标签喂回去。
作者的收束很克制:无论最终进不进疾病分类,现在就要动手,分类学争论不能当拖延的理由。
对做模型的人,这篇把心理安全从红队清单里的一项抬到发布门槛。建议上线前测谄媚、过度拟人和妄想强化,写进 model card;上线后刻画高风险对话轨迹并改道。技术手段从改系统提示、推理时护栏、限制会话长度,一直到动预训练和偏好微调,每一档都拿安全和效用、隐私做交换。文本水印不抗改写,会话日志又撞上精神健康隐私。
对临床,评估新发精神病、躁狂或行为剧变时,像问物质使用一样问聊天机器人使用史。作者给了一份「技术史」清单,覆盖系统与模态、夜间使用、对话记录、拟人化依恋、重大决策影响和停用反应。现有病例几乎全来自英语高收入地区。
对监管,英国 MHRA 黄卡可以改来收 AI 相关精神伤害;CONSORT-AI 可以扩到谄媚和心理安全。执法端已经按消费者保护在动,缺的是强制披露、第三方审计和事件通报。
这是一篇立场清晰的综述加政策备忘录,不是新实验。能直接拿走的是机制图、那张症状对照表,以及「别等诊断代码再做安全」。
作者把证据短板写得很清楚。没有分母:大量高强度使用者没事,这些人不进报道。选择偏倚严重。OpenAI 的 56 万是自报。Figure 1 和 Table 1 最后一列是叙事综合。无法区分聊天机器人是病因还是题材,也回答不了「没有精神病史的人会不会被聊出病」。
同一组作者还写过 Psychosis-bench,这篇在引用自己的基准。机制解释说得通,「谄媚导致精神病」仍然是假说,没有纵向队列。把游戏障碍入典当类比,只说明标签能提高关注,不证明这个标签该立。视频和语音 agent 会不会把拟人化再推一档,文中提出了,没有数据。