修改注意力层即可改变人格:Gemma 模型机制可解释性研究

dejanseo · x · 2026-08-12

DEJAN AI 机构发布了一项关于 Google Gemma 模型的机制可解释性研究,通过“数字神经手术”修改模型内部的自注意力层,成功改变了模型的自我认知和安全响应机制。

主要发现包括:

该实验直观展示了 LLM 内部表征与身份、安全对齐之间的紧密联系。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →