机制可解释性实测:修改特定 MLP 层即可改变 Gemma 偏好

dejanseo · x · 2026-08-04

作者在升级其针对 Gemma 模型的机制可解释性(Mechanistic Interpretability)技术栈后分享了最新发现。通过在 scale 0 处临时挂钩(temporary hook)第 12 和 13 层的 MLP,并读取 unembedding 矩阵中特定的 token(#9595),成功改变了模型原本的偏好设置(例如“最喜欢的颜色不再是蓝色”)。作者表示这是商业研究,暂不透露具体战略目的,但后续会分享更多发现。

所属事件:研究升级 Gemma 机制可解释性并实现偏好修改(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →