研究升级 Gemma 机制可解释性并实现偏好修改

研究者近期升级了针对 Gemma 模型的机制可解释性工具栈,并分享了最新实验发现。实测表明,通过在特定层级临时挂钩并修改相应的 MLP 层,能够直接改变 Gemma 模型的输出偏好。尽管出于商业机密原因,研究者暂未透露具体的战略目的,但承诺未来几天将公布更多详细的研究成果。

2026-08-04 ~ 2026-08-04 · 2 条相关