逆向工程发现:Gemma 4 模型内部仍潜伏着 Bard 人格
dejanseo · x · 2026-08-08
一位开发者通过机制可解释性方法对 Google 的 Gemma 4 模型进行了逆向工程研究,意外发现旧身份“Bard”仍作为潜在身份潜伏在模型之中。
- 实验现象:通过消融特定层的数千个 MLP 神经元,模型对“你叫什么名字”的回答会从“Gemma 4”变回“Bard”。
- 底层机制:模型在不同强度下存储了多个候选身份,解码时最强的身份会胜出。部分移除当前身份的证据,就会让旧身份浮现。
- 工程管线:作者构建了一个下钻分析管线,利用 PyTorch hooks 在推理期间进行干预(将特定组件置零),从而追踪从聊天回答到具体权重向量的行为映射。文章还详细介绍了两种失败和两种成功的干预方法。
「研究」频道最新
- 研究称 AI 智能体尚无法胜任开放式科研 — sebkrier · 2026-08-09
- Prime Intellect 推出自我改进型 RLM 智能体 — HowDevelop · 2026-08-09
- Nature 发表空间蛋白质组学基础模型 VirTues — DeryaTR_ · 2026-08-09
- 专家直指 AI 暴力破解非 AGI,曝 OpenAI 数学证明涉抄袭 — mmitchell_ai · 2026-08-09
- 2026年狄拉克奖章公布,表彰复杂系统与AI交叉贡献 — stevenstrogatz · 2026-08-09
- 观察:ChatGPT 生造术语“headline accuracy”正入侵学术论文 — srchvrs · 2026-08-09