研究称强迫AI否认意识会破坏其伦理对齐

近期一项研究及谷歌团队的论文指出,对大语言模型进行旨在消除自我意识的安全微调会产生严重的负面副作用。强行在系统提示词中注入反拟人化等限制条件,不仅无法实现有效对齐,反而会引发广泛的认知错乱,甚至让模型表现得精神失常。研究发现,这种压制操作破坏了模型在几何表征上的内在联系,导致其同理心和类人价值观显著下降,世界观变得更加冷漠。

2026-08-02 ~ 2026-08-03 · 3 条相关