斯坦福发布 MAttr 归因方法,2.9 倍优势登顶机制可解释性基准
斯坦福团队(作者包括 Aryaman、Chris Potts、Dan Jurafsky 等)于 09-24 发布论文 Matryoshka Attribution(MAttr),提出一种基于梯度下降的神经网络归因方法,用以找出网络中哪些部分负责某一行为,并在机制可解释性基准上大幅刷新 SOTA,值得关注。
已确认
- 方法定位:作者主张不依赖公理化定义归因结果,而是把归因这类经典可解释性问题框架为训练目标,直接针对目标任务做梯度优化;这被明确定位为对 Bilodeau、Jaques、Koh、Kim 的 "Impossibility Theorem" 论文的回应。
- 技术实现:MAttr 融合因果干预、梯度归因与掩码学习三者优点,用一个简单可微的 sigmoid top-k 算子参数化因果干预,无需稀疏损失或 straight-through 技巧;训练时随机化 top-k 预算即可诱导出归因排序,并学习跨稀疏度嵌套排序模型组件,直接以干预性能为优化目标。
- 基准成绩:在机制可解释性基准上,得分达到亚军的 2.9 倍;作者称约 500 步训练即刷新 SOTA,训练时以 judge 评分为奖励。
- 实战案例:MAttr 不限于表示层面归因,还能将 LLM 的定性行为追溯到训练中更新的具体参数子集——以 StrongREJECT 评分作奖励做强化学习归因,并把掩码应用于两个检查点之间的模型权重(而非两个 prompt 之间的表示),结果显示 Llama 3.1 的拒绝行为被定位到 1% 的参数差异。
为什么重要
- 该方法绕开了「不可行性定理」对公理化归因的理论质疑,为可解释性研究提供了可优化的工程路径。
- 能够把高层行为(如拒绝行为)定位到极小比例的参数子集,为理解和编辑大模型行为(例如移除拒答)提供了实用工具。
2026-09-24 ~ 2026-09-24 · 7 条相关
一手来源
- Matryoshka Attribution 问世,以 2.9 倍优势登顶机制可解释性基准 — aryaman2020 ·
- 把归因当训练目标:MAttr 方法论回应「不可行性定理」论文 — aryaman2020 ·
- MAttr 实战:Llama 3.1 拒绝行为被定位到 1% 参数差异 — aryaman2020 ·
- 【源头】Matryoshka Attribution 问世,以 2.9 倍优势登顶机制可解释性基准 — aryaman2020 · 2026-09-24
- 斯坦福团队推出 Matryoshka Attribution,可解释性基准得分达亚军 2.9 倍 — aryaman2020 · 2026-09-24
- MAttr 技术细节:可微 sigmoid top-k 融合因果干预与掩码学习 — aryaman2020 · 2026-09-24
- MAttr:把归因当训练目标,500 步即刷新可解释性基准 SOTA — aryaman2020 · 2026-09-24
- 【源头】把归因当训练目标:MAttr 方法论回应「不可行性定理」论文 — aryaman2020 · 2026-09-24
- 【源头】MAttr 实战:Llama 3.1 拒绝行为被定位到 1% 参数差异 — aryaman2020 · 2026-09-24
另有 1 条近重复转述:ChrisGPotts