Matryoshka Attribution 用梯度下降做归因,登顶可解释性基准

stanfordnlp · x · 2026-09-26

Noah Goodman 转发并评论了新论文 Matryoshka Attribution:这是一种新的归因方法,用梯度下降来定位神经网络中负责某一行为的部分,而不是传统的人工搜索回路。

在 Mechanistic Interpretability Benchmark 上,MAttr 以大幅优势排名第一,得分是第二名的 2.9 倍。

所属事件:斯坦福提出 Matryoshka Attribution 归因法登顶可解释性基准(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →