斯坦福新论文 Matryoshka Attribution 登顶可解释性基准
stanfordnlp · x · 2026-09-26
斯坦福团队(Aryaman Arora、Noah Goodman、Dan Jurafsky、Christopher Potts 等)发布可解释性新论文 Matryoshka Attribution(MAttr)。
- 问题:将 LLM 输出归因到内部计算,现有因果干预/梯度/可学习掩码方法要么代价过高,要么找不准真正因果关键的内部组件
- 方法:把归因定义为「寻找最小化下游损失的嵌套内部组件子集」,用可微 sigmoid top-k 算子参数化掩码,训练时随机化 k 同时监督所有稀疏度,学到组件按归因分数的排序
- 成果:在 Mechanistic Interpretability Benchmark 官方排行榜登顶,识别出的稀疏电路具备跨基底迁移性
- 应用:用强化学习训练 MAttr 定位微调中导致下游行为的权重变化——把 Llama 3.1 8B Instruct 仅 1% 的权重恢复到基座状态,即可移除拒答行为
所属事件:斯坦福提出 Matryoshka Attribution 归因法登顶可解释性基准(2 条相关)→
「研究」频道最新
- Claude 挑战理论物理九圈计算,突破此前八圈纪录 — ctjlewis · 2026-09-26
- 用「逆向工程蜂群」从掩码输出反推程序,得到可解释符号模型 — cephaloform · 2026-09-26
- 一个两栖动物问题就能识别模型评测:研究者提出 spurious probe — AdtRaghunathan · 2026-09-26
- Falcon Perception 用 GRPO 升级,可一次检测 500 个目标 — HildeKuehne · 2026-09-26
- AI 预言家:仅看训练数据即可提前预测模型是否会出现欺骗等失对齐 — tomekkorbak · 2026-09-26
- 数学「考古」:Calegari 追溯 AI 证明 ζ(5) 无理性的思想源头 — ctjlewis · 2026-09-26