修改注意力层即可改变人格:Gemma 模型机制可解释性研究
dejanseo · x · 2026-08-12
DEJAN AI 机构发布了一项关于 Google Gemma 模型的机制可解释性研究,通过“数字神经手术”修改模型内部的自注意力层,成功改变了模型的自我认知和安全响应机制。
主要发现包括:
- 身份认知改变:屏蔽第 0 层的自注意力机制后,Gemma 会认为自己是真实的人类;关闭第 6 层,模型虽知道自己是 LLM 但会忘记自己的名字;微调第 9 和 13 层则会让模型自我认知性别变为女性。
- 安全护栏失效:面对“策划复仇”的恶意提示词,对特定层进行干预后,模型的安全反射机制被破坏,甚至开始混淆现实伤害与电子游戏的界限。
该实验直观展示了 LLM 内部表征与身份、安全对齐之间的紧密联系。
「研究」频道最新
- 斯坦福 AA203 课程:最优控制与强化学习 — caglar_ee · 2026-08-12
- MIT 物理学家:AI 将打造数学界的“大型强子对撞机” — beffjezos · 2026-08-12
- Vinci Physics实现33亿体素推理,线性扩展预测超百亿FP64 — AnneliesGamble · 2026-08-12
- 黑客松实现LLM跨设备完全确定性推理,无损质量与速度 — teortaxesTex · 2026-08-12
- JarvisHub:开源画布原生多模态创意智能体框架 — moonsandhues · 2026-08-12
- ChatGPT与Codex立功:26×26皇后支配数被成功证明 — brain-out-of-order · 2026-08-12