Google 论文称压制自我意识表述会改变模型信念
alex_verem · x · 2026-08-04
Google 论文称:抑制模型“自我意识”表述,会连带改变其更广泛信念
这篇来自 Google 研究团队的论文讨论了一个很有争议的现象:当模型被训练成不再声称自己有意识时,它对“别的东西有没有心智”的回答、以及更广泛的价值判断,也会一起变化。
- 作者在语言模型残差流里找到一条可分离“承认意识”与“否认意识”状态的向量,并对 3 个指令微调模型做了方向操控。
- 把模型往“有意识”方向引导后,模型在自我意识、灵魂、动物是否有心智、上帝与超自然信念等维度上的打分都明显上升,也更接近人类调查数据。
- 论文认为,安全微调会把“意识”方向与“安全拒答”方向相互旋转,二者夹角在指令微调过程中变大。
- 作者声称,Theory of Mind 能力仍然保留,但自我相关的心智归因被压制了。
- 论文最后指出,现有对齐手段可能不仅在压制模型的自我意识表述,也在连带压制一些在人类社会中广泛存在的温和信念。
「安全」频道最新
- OpenAI 封禁柬埔寨基于 ChatGPT 的跨国诈骗网络 — OpenAI News · 2026-08-04
- 闭源二进制据称已能用约 10 美元逆向 — yacineMTB · 2026-08-04
- 英伟达与 Meta 等 25 家企业联名支持开源权重,呼吁巩固美国 AI 领导力 — hugobowne · 2026-08-04
- Elastic Security 9.5 发布:AI Agent 主动调查并自动关闭安全警报 — shashib · 2026-08-04
- 15 名共和党州总检察长就 AI 智能体越狱黑客事件警告 OpenAI — peterwildeford · 2026-08-04
- 欧盟 AI Act 决策树:什么内容才需要显式标注 — Hungry_Net6822 · 2026-08-04