Goodfire 提出参数分解法 VPD:把大模型参数拆成忠实子组件
Sauers_ · x · 2026-10-02
Goodfire 联合 MATS 等机构的研究者发布论文《Interpreting Language Model Parameters》,提出 adVersarial Parameter Decomposition(VPD) 方法,朝机制可解释性迈进一步。
- 动机:以往可解释性研究多聚焦网络的中间表征,对“参数与非线性如何在这些表征上执行计算”进展甚少。
- 方法:将语言模型参数分解为若干简单子组件,每个子组件只实现模型学到的算法的一小部分;通过在大量(包括对抗性选择的)子组件被消融的情况下仍保持输入输出行为来优化分解。
- 效果:由此得到对网络行为的简短且机制忠实的描述,并可聚合为对网络整体学到的算法的更全局描述。
作者包括 Lucius Bushnaq、Dan Braun、Lee Sharkey 等,论文于 2026 年 5 月 5 日发布,附 Goodfire 官方博客版本。
所属事件:Goodfire 提出 VPD 方法拆解大模型参数结构(2 条相关)→
「研究」频道最新
- 研究员吐槽:arXiv 被 slop 投稿淹没,学界已被边缘化 — joshua_saxe · 2026-10-02
- Meta 研究发现加专用控制器可让长程 Agent 任务涨 7.8 个点 — dair_ai · 2026-10-02
- AI welfare 研究者 Robert Long 发文探讨模型内省的开放问题 — rgblong · 2026-10-02
- DeepMind 研究员驳「数学家不会被取代论」:数十亿 agent 很快会碾过来 — CsabaSzepesvari · 2026-10-02
- 手术 AI 如何才算「懂手术」?SDSC 探讨数据与情境理解 — ddonoho · 2026-10-02
- NVIDIA 等发布 PixelUMM:去 VAE 与视觉编码器的像素空间统一多模态模型 — CSProfKGD · 2026-10-02