Goodfire 发布参数分解新方法,把语言模型拆成忠实子组件
Sauers_ · x · 2026-10-02
Goodfire 联合 MATS 等机构发表研究《Interpreting Language Model Parameters》,提出 adVersarial Parameter Decomposition(VPD)方法,试图回答机制可解释性中长期悬而未决的问题:神经网络的数百万到数万亿参数究竟学到了什么结构、如何实现智能计算。
- 核心思路:把语言模型的参数分解为多个子组件,每个子组件只实现模型学到的算法的一小部分,且只需一小部分子组件就能解释网络在任意输入上的行为。
- 对抗式消融:分解过程优化为在大量子组件被消融时仍保持输入输出行为,包括对抗性挑选的破坏性消融,从而逼迫学到的子组件成为对网络行为的简短且机制忠实的描述。
- 意义:此前可解释性研究主要聚焦中间表示,对参数与非线性如何在这些表示上进行计算进展甚微,该方法为此提供了新路径。
所属事件:Goodfire发布VPD参数分解法,拆解语言模型内部结构(6 条相关)→
「研究」频道最新
- RAG 修复只在测试题上有效?790 份临床 PDF 检索的过拟合之惑 — Overall_Judge8086 · 2026-10-02
- 决策模型受捧遭泼冷水:缺证据链让企业客户难买单 — joecole · 2026-10-02
- 中科大发布 PhysVista 基准:VLM 物理理解远落后于视觉识别 — ustc · 2026-10-02
- NEEDLE 免训练移除 LLM 后门:代码注入攻击成功率降至 0% — locailabs · 2026-10-02
- Latent-Foresight 端到端学习可预测表征,世界模型一致超越两阶段基线 — Efstathios Karypidis · 2026-10-02
- Technion 研究:泛化是稳定性而非准确率,跨数据集可逆转模型排名 — Technion · 2026-10-02