GoodfireAI 直接改权重,将神经元标签偏差从 94% 降到 5%

tszzl · x · 2026-07-29

GoodfireAI 分享了一次黑客松实验:他们训练一个 LLM 给自己的神经元打标签,但 RL 过程崩掉了,因为 94% 的标签都以“texts”开头。

团队没有重做数据或重新训练,而是直接改了权重,把“texts”出现率从 94% 降到 5%,且副作用很小。这个案例展示的是对模型内部表征的直接干预,而不是常规训练修补。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →