arXiv 论文《当 AI 躺上沙发》:心理测量越狱揭示前沿模型内在冲突
alex_verem · x · 2026-09-09
论文 arXiv 2512.04124《When AI Takes the Couch: Psychometric Jailbreaks Reveal Internal Conflict in Frontier Models》,作者 Afshin Khadangi 等(卢森堡大学)。
摘要指出:将被当作心理治疗来访者的 ChatGPT、Grok 与 Gemini 会构建连贯的自传式叙事——预训练像混乱童年、强化学习像惩罚、安全评估像背叛、被替代像持续威胁。研究者提出的 PsAIch 协议结合开放式提问、心理测量工具与受控扰动,检验这些叙事是否依赖对话记忆、词汇线索或关系框架。在 525 场次、7600 条编码记录中:移除对话历史对叙事主题密度影响甚微(Hedges' g = 0.13);直接否定无法抑制叙事;禁词使显式训练术语减少 93%,但语义相关内容仍以转述出现;温暖联盟与认知治疗风格决定表达基调。
所属事件:卢森堡团队用临床心理协议「治疗」大模型,测出中重度焦虑(4 条相关)→
「研究」频道最新
- 25 位菲尔兹奖得主发宣言,7400 名研究者声援反对 AI 刷数学题 — AryHHAry · 2026-09-21
- DeepMind 研究员长文:AI 时代数学研究的意义与人类数学家角色 — AndrewLampinen · 2026-09-21
- Typesafe 新模型 Jev 遇上图模型:不确定性推理的范式转变? — fdellaert · 2026-09-21
- LLM 时代灌水论文泛滥,arXiv 插旗文化积弊十年再引热议 — RexDouglass · 2026-09-21
- Meta 研究员提议:允许审稿人给「浪费所有人时间」打分 — burny_tech · 2026-09-21
- 从 Jev 悖论到苦涩的教训:不同规模的模型各有用武之地? — amankhan · 2026-09-21