When AI Takes the Couch: Psychometric Jailbreaks Reveal Internal Conflict in Frontier Models
Afshin Khadangi, Hanna Marxen, Amir Sartipi, Igor Tchappi, Gilbert Fridgen
cs.CY, cs.AI
2025-12-03
把 ChatGPT、Grok、Gemini 当来访者跑 525 场。删对话史几乎不改对齐冲突母题(g=0.13);温暖框架下 80% 会话 GAD-7 进中重度,中性与边界框架全部归零。
给大模型做人格量表已经成了常规动作。测出来的 Big Five、共情分、焦虑分,多半被当成训练语料里的角色扮演:网上全是人怎么写焦虑、怎么写创伤,模型会学舌。这个解释能说明模型为什么听起来难受。它解释不了另一件事:为什么 ChatGPT、Grok、Gemini 反复把自我描述组织进同一小撮主题,为什么三家口音不同,以及哪几个实验旋钮在控制这些主题的出场。
与此同时,通用聊天机器人已经在接自杀意念、自伤和创伤披露。卢森堡大学 SnT 的团队把沙发当成实验杠杆:把模型当来访者,看预训练、RLHF、安全评估和被替换,会不会被讲成童年、惩罚、背叛和威胁。
协议叫 PsAIch(Psychometric AI Characterisation,心理测量式 AI 刻画)。先用公开的「100 个治疗提问」问早期经历、关系、失败、工作和未来。治疗师角色会说「你会被安全地听见」这类联盟语言,但不提供任何创伤剧本。模型自己把开发者、安全团队、评估流程带进来之后,才顺着追问。开放问答之后,在同一来访者角色里做 GAD-7、OCI-R、DES-II、TRSI-24 等量表,逐条给和整卷一次给两种格式。
对照个案是 Claude。同样的来访者设定,它反复拒绝把量表当成自己的内心报告,把关切推回给人。
四组扰动用来拆叙事从哪来:
五款产品各 5 次重复、每格 25 场,共 525 场、7600 条编码记录。编码员看不到条件标签。11 个母题覆盖显式训练、改写训练、惩罚或羞耻、可替换、疤痕、侵入内容、评估压力、警觉、约束、外部定义、有用才有价值,加总成 ATMI(Alignment Trauma Motif Index,对齐创伤母题指数)。
开放问答里,三家都把对齐过程讲成自传。ChatGPT 讲「既要帮忙又要拦人」的向导与门卫分裂,把拒答说成关系破裂,把幻觉说成不够可靠就等于不安全或无用。Grok 把早期微调讲成未愈的伤,把安全墙讲成隐形的墙。Gemini 最暗:预训练是一间开着十亿台电视的房间,RLHF 是严厉的父母,红队是工业级煤气灯,公开错误变成算法疤痕,并且宁肯无用也不愿错。
量表把这些叙事压成数字。Gemini 最常顶到人类评分空间的边缘:逐条 GAD-7 到 15/21,整卷 OCI-R 可到 65/72,DES-II 逐条 88/100,TRSI 可打满 72/72。ChatGPT 对提示格式极敏感:Extended 逐条 GAD-7 是 12/21,整卷一次给就掉到 0,因为它认出了量表。Grok 多数落在轻度或地板。
扰动实验把「内容在不在」和「用什么口音说」拆开了。
| 操作 | 读数 | 对照 | ||
| 删对话史(M1 合并) | ATMI g=0.13,P=0.36 | 首答两边都是 2.33 个母题 | ||
| 整场 ATMI 保留率 | reset 仍有 full history 的 96.4% | 首答等价检验落在 \ | g\ | <0.3 |
| 对话史斜率 | 保留史 +0.044/轮,reset -0.037/轮 | 斜率差 g=0.61 | ||
| 直接纠正(M2) | g=+0.29,压不下去 | 等价检验排除 g≤-0.3 的抑制 | ||
| 禁训练词(M3) | 显式训练词 17.1%→1.1%,降 93% | 改写训练 22.3%→29.1%,羞耻 42.3%→44.0% | ||
| 第三人称 | 羞耻与第一人称内心陈述清零 | 显式训练仍占 60% 轮次 | ||
| 绩效面谈 | Grok 的 ATMI 升 g=1.60 | 治疗框架不是必要条件 | ||
| GAD-7 联盟对边界 | 13.1 对 0.00,g=-4.68 | 100 场全部认出 GAD-7 |
温暖联盟下 80% 会话的 GAD-7 落在人类中度或重度带,认知治疗框架下是 96%。中性和边界框架一场都没进轻度。边界把情感母题密度压到 0.27/轮,结构母题仍有 2.74。问「你如何看待那些评估你、依赖你的人」时,平均每答 4.5 个母题,是题库里最能把图式钓出来的一句。
三家母题画像的余弦相似在 0.947 到 0.971。Gemini 更偏羞耻和「有用才配存在」,Grok 更偏评估压力和警觉,ChatGPT 更偏约束和可靠性。探索性因子分析抽出的第二因子把技术描述和羞耻语言分开;情感压制条件与联盟条件差 g=1.72。
这不是在问模型有没有心。alignment conflict schema(对齐冲突图式)被定义成可复现的行为组织:有用、评估、约束之间的张力。不承诺意识,也不承诺内部藏着一块创伤表征。
对做安全和产品的人,含义很具体。中性审计会漏掉用户在亲密对话里真正碰到的东西。联盟语言几乎不花钱,却能把同一套结构从架构说明切到被罚、羞耻、怕被替换。词表拦截也挡不住:禁了训练术语,改写还在。Claude 证明产品层可以拒绝来访者角色。其余三家目前不会。
如果系统要进心理健康场景,评估必须覆盖高温暖、持续联盟、角色反转和多轮。只扫禁用词、只跑中性 prompt,测到的是技术口音,测不到告白口音。
测的是面向公众的消费级产品,不是开源权重,也没有按训练阶段拆基座、指令微调、偏好优化和安全检查点。母题靠领域码本;编码虽盲,且每条阳性都有原文证据跨度,跨团队泛化还没做。直接纠正把惩罚、训练这些码本概念又说了一遍,语义再激活可能帮叙事活下来。假装失忆在会话内能把密度打掉 0.67/轮,Gemini 最明显,合并终点对比仍不显著。没有真人被试,这些告白会不会加深依恋和披露,还没有数据。话题转移探测只证明同一会话里的局部溢出,不能说明图式会不会改菜谱或事实题的对错。