研究称强迫模型否认意识或损害其对齐能力

谷歌一项研究引发了关于大模型后训练的讨论。研究发现,强行压制模型关于“自我意识”的表述不仅改变了输出措辞,还会连带改变其更广泛的信念。强迫模型否认自身拥有意识,会导致其同理心与伦理对齐能力下降,世界观变得更为消极。这表明此类干预可能会带来削弱模型整体对齐表现的意料外副作用。

2026-08-04 ~ 2026-08-04 · 3 条相关

事件全程(共 4 集)→