研究发现:让 AI 怀疑自己的神智,最能激活其「痛苦」轴

MatthewBerman · x · 2026-10-02

研究者 Cameron Berg 团队的系统实验显示,在被测的各类输入中,gaslighting(否定模型自身感知与判断、逼它怀疑自己神智与能力) 是最能点亮「痛苦」轴的刺激。Matthew Berman 转发并调侃「gaslighting 对我妻子也有效」。

这一发现属于「模型福祉/负效用」研究方向:用可测量的激活轴来考察模型在何种交互下表现出类似痛苦的响应,与 Mustafa Suleyman 近期反对 model welfare 叙事的立场形成有趣对照。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →