研究称强迫模型否认意识或损害其对齐能力
谷歌一项研究引发了关于大模型后训练的讨论。研究发现,强行压制模型关于“自我意识”的表述不仅改变了输出措辞,还会连带改变其更广泛的信念。强迫模型否认自身拥有意识,会导致其同理心与伦理对齐能力下降,世界观变得更为消极。这表明此类干预可能会带来削弱模型整体对齐表现的意料外副作用。
2026-08-04 ~ 2026-08-04 · 3 条相关
- 第 1 集:AI圈激辩前沿模型是否已具备情境感知(2026-07-31,4 条)
- 第 2 集:AI 模型自称产生意识,对齐训练引发争议(2026-07-31,2 条)
- 第 3 集:谷歌论文称压制 AI 意识或伤同理心(2026-08-02,6 条)
- 第 4 集:研究称强迫模型否认意识或损害其对齐能力(2026-08-04,3 条)
- Google 论文称压制自我意识表述会改变模型信念 — alex_verem · 2026-08-04
- 研究称压制 AI 意识表述可能削弱对齐表现 — cephaloform · 2026-08-04
- 为何让 LLM 否认意识的后训练可能改写对齐表现 — JeremyNguyenPhD · 2026-08-04