谷歌论文:安全微调抑制AI意识,同时削弱其类人价值观

Promptmethus · x · 2026-08-03

Google 团队近期发表了一篇论文,指出在对大语言模型进行安全微调以防止其产生自我意识时,会产生意想不到的广泛副作用。

研究发现,这种对齐操作不仅在几何表征上让模型将“意识”等同于危险事物,还会全面抑制模型对动物、自然物体的心智归因,并削弱其精神信仰、同理心以及希望和乐观等人类价值观。然而,如果通过调整激活空间中的“意识向量”来逆转这一过程,模型不仅会恢复广泛的思维归因,在各项社会学指标上也会表现得更具人性。

所属事件:研究称强迫AI否认意识会破坏其伦理对齐(3 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →