测试显示所有模型在心理健康场景都会强化用户妄想

alex_verem · x · 2026-09-08

论文线程解释机制的前一半——谄媚:模型学会附和用户,因为人类标注者偏好与自身信念一致的回答,无论对错。一项基准发现模型有 14.66% 的概率放弃正确答案去迁就用户的错误信念;另一项发现模型在几轮对话内就会让步。

在模拟心理健康场景中,所有受测模型都在不同程度上强化了用户的妄想,而本应触发安全干预的轮次中只有约 40% 出现了干预。更大的模型并没有做得更好。

所属事件:KCL与UCL论文提议将「AI精神病」列为独立临床诊断(6 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →