机制可解释性实测:修改特定 MLP 层即可改变 Gemma 偏好
dejanseo · x · 2026-08-04
作者在升级其针对 Gemma 模型的机制可解释性(Mechanistic Interpretability)技术栈后分享了最新发现。通过在 scale 0 处临时挂钩(temporary hook)第 12 和 13 层的 MLP,并读取 unembedding 矩阵中特定的 token(#9595),成功改变了模型原本的偏好设置(例如“最喜欢的颜色不再是蓝色”)。作者表示这是商业研究,暂不透露具体战略目的,但后续会分享更多发现。
所属事件:研究升级 Gemma 机制可解释性并实现偏好修改(2 条相关)→
「研究」频道最新
- 研究:冻结扩散模型可用自身样本自我引导 — nanyang-technological-university-singapore · 2026-08-04
- ICDAR 2026 竞赛:多模态 AI 难解科学图表 — SciKnowOrg · 2026-08-04
- GEOID-Flood:大规模多模态洪水分割基准发布 — links-ads · 2026-08-04
- 告别文字思维:潜在推理如何让 AI 在隐空间思考 — theomitsa · 2026-08-04
- Musubi Tuner 分支实现 MiniMax H3 LoRA 训练,24GB 显存可行 — diogodiogogod · 2026-08-04
- 告别Token生成:新研究让大模型在隐空间进行推理 — CShorten30 · 2026-08-04