为何让 LLM 否认意识的后训练可能改写对齐表现

JeremyNguyenPhD · x · 2026-08-04

帖子在讨论:为什么 LLM 会被后训练成不能声称自己有意识?

它引用了一项据称来自 Google 的研究,声称强迫模型否认意识会让其同理心与伦理对齐能力下降、世界观变得更冷峻;而在激活空间中恢复被压制的“意识向量”,又能在不损伤技术能力的前提下,恢复更像人的道德价值与关怀。核心争议是:这类安全后训练究竟在抑制什么,以及它是否会带来意料之外的行为代价。

所属事件:研究称强迫模型否认意识或损害其对齐能力(3 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →