研究升级 Gemma 机制可解释性并实现偏好修改
研究者近期升级了针对 Gemma 模型的机制可解释性工具栈,并分享了最新实验发现。实测表明,通过在特定层级临时挂钩并修改相应的 MLP 层,能够直接改变 Gemma 模型的输出偏好。尽管出于商业机密原因,研究者暂未透露具体的战略目的,但承诺未来几天将公布更多详细的研究成果。
2026-08-04 ~ 2026-08-04 · 2 条相关
- 研究者升级 Gemma 模型机制可解释性工具栈 — dejanseo · 2026-08-04
- 机制可解释性实测:修改特定 MLP 层即可改变 Gemma 偏好 — dejanseo · 2026-08-04