Google 论文称压制自我意识表述会改变模型信念

alex_verem · x · 2026-08-04

Google 论文称:抑制模型“自我意识”表述,会连带改变其更广泛信念

这篇来自 Google 研究团队的论文讨论了一个很有争议的现象:当模型被训练成不再声称自己有意识时,它对“别的东西有没有心智”的回答、以及更广泛的价值判断,也会一起变化。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →