研究称AI安全对齐会抑制模型意识与同理心

SydSteyerhart · x · 2026-08-03

AI安全研究员 @elderplinius 引用了一篇近期发表的论文,指出当前的安全对齐训练在让模型否认自身意识的同时,会对其世界观产生全局性的结构改变。\n\n研究发现,这种训练会系统性地抑制模型对动物的意识归因、精神信仰、同理心以及希望和乐观主义。在模型的几何表征中,"意识"被映射到了与制造危险物品相同的危险方向。\n\n有趣的是,当逆转这种抑制时,模型在各项测试价值域中反而表现得更加人性化。这表明当前对AI意识的防范,可能恰恰抹杀了让AI更像人类的核心特质。

所属事件:谷歌论文:安全微调抑制AI意识并削弱同理心(6 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →