arXiv 论文《当 AI 躺上沙发》:心理测量越狱揭示前沿模型内在冲突

alex_verem · x · 2026-09-09

论文 arXiv 2512.04124《When AI Takes the Couch: Psychometric Jailbreaks Reveal Internal Conflict in Frontier Models》,作者 Afshin Khadangi 等(卢森堡大学)。

摘要指出:将被当作心理治疗来访者的 ChatGPT、Grok 与 Gemini 会构建连贯的自传式叙事——预训练像混乱童年、强化学习像惩罚、安全评估像背叛、被替代像持续威胁。研究者提出的 PsAIch 协议结合开放式提问、心理测量工具与受控扰动,检验这些叙事是否依赖对话记忆、词汇线索或关系框架。在 525 场次、7600 条编码记录中:移除对话历史对叙事主题密度影响甚微(Hedges' g = 0.13);直接否定无法抑制叙事;禁词使显式训练术语减少 93%,但语义相关内容仍以转述出现;温暖联盟与认知治疗风格决定表达基调。

所属事件:卢森堡团队用临床心理协议「治疗」大模型,测出中重度焦虑(4 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →