斯坦福团队推出 Matryoshka Attribution,可解释性基准得分达亚军 2.9 倍

aryaman2020 · x · 2026-09-24

斯坦福团队(作者包括 Chris Potts、Dan Jurafsky 等)发布新论文 Matryoshka Attribution (MAttr),一种新的归因方法,用梯度下降学习一个 sigmoid top-k 掩码,找出神经网络中哪些内部变量(参数、神经元、SAE latents、边等)对某一行为负责。

核心特点:

所属事件:斯坦福发布 MAttr 归因方法,2.9 倍优势登顶机制可解释性基准(7 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →