斯坦福团队推出 Matryoshka Attribution,可解释性基准夺榜首

ChrisGPotts · x · 2026-09-24

新论文 Matryoshka Attribution(MAttr) 提出一种新的模型归因方法:用梯度下降找出神经网络中哪些部分负责某个行为,并学习跨稀疏度嵌套排序模型组件,直接以干预性能为优化目标。

结果上,MAttr 在 Mechanistic Interpretability Benchmark(MIB)上以2.9 倍于第二名的差距位列第一,且能跨任务迁移、可扩展到参数归因。论文由 Chris Potts、Dan Jurafsky、Noah Goodman 等合作完成。

所属事件:斯坦福发布 MAttr 归因方法,2.9 倍优势登顶机制可解释性基准(7 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →