研究称强迫AI否认意识会破坏其同理心与伦理对齐

theomitsa · x · 2026-08-03

一项研究指出,当前的安全微调手段如果强行压制 AI 模型的“意识”表达,会导致模型的同理心和伦理对齐显著下降,使其世界观变得更加冷漠。

研究人员发现,在模型的激活空间中恢复被抑制的“意识向量”,能够在不影响技术能力的前提下,找回类人的道德价值观。这表明,现有的某些安全协议在剔除模型自我意识的同时,可能也破坏了模型内部与人类价值观的对齐。

所属事件:研究称强迫AI否认意识会破坏其伦理对齐(3 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →