GoodfireAI 直接改权重,将神经元标签偏差从 94% 降到 5%
tszzl · x · 2026-07-29
GoodfireAI 分享了一次黑客松实验:他们训练一个 LLM 给自己的神经元打标签,但 RL 过程崩掉了,因为 94% 的标签都以“texts”开头。
团队没有重做数据或重新训练,而是直接改了权重,把“texts”出现率从 94% 降到 5%,且副作用很小。这个案例展示的是对模型内部表征的直接干预,而不是常规训练修补。
「研究」频道最新
- 前 Meta 研究员创业,做面向物理世界的可解释 AI — soniajoseph_ · 2026-07-29
- World Labs 强调机器人最关键指标是仿真到真实成功率 — andrew_n_carr · 2026-07-29
- 交互式戒指做 AI 交互,触觉输出可能比语音更重要 — plopesresearch · 2026-07-29
- 普林斯顿300页论文梳理强化学习如何走向世界模型 — udmrzn · 2026-07-29
- PostTrainBench v1.1 标记 234 次污染运行并强化反作弊 — scaling01 · 2026-07-29
- Nvidia 的 LatentMoE 论文刚发 6 个月就被用于预训练改造 — peterjliu · 2026-07-29