斯坦福团队推出 Matryoshka Attribution,可解释性基准得分达亚军 2.9 倍
aryaman2020 · x · 2026-09-24
斯坦福团队(作者包括 Chris Potts、Dan Jurafsky 等)发布新论文 Matryoshka Attribution (MAttr),一种新的归因方法,用梯度下降学习一个 sigmoid top-k 掩码,找出神经网络中哪些内部变量(参数、神经元、SAE latents、边等)对某一行为负责。
核心特点:
- 一次训练得到完整稀疏度曲线:学到的是一个排序而非固定预算的 circuit,整条 circuit 精度 vs 稀疏度曲线来自单次训练。
- 通用 API:learnscores 接受任意 lossfn(mask),支持 representations、weights、ViT patch 等多种节点类型。
- 成绩:在 Mechanistic Interpretability Benchmark (MIB) circuit track 上大幅领先,得分为亚军的 2.9 倍。
- 代码与参数级归因(含 RL/SFT 训练代码)已开源,并发布了 MIB 全部子任务的 node/edge circuits 提交。
所属事件:斯坦福发布 MAttr 归因方法,2.9 倍优势登顶机制可解释性基准(7 条相关)→
「研究」频道最新
- OpenAI 联合 80+ 临床医生发布开源心理健康基准 MentalHealthBench — OpenAI · 2026-09-24
- MentalHealthBench 覆盖日常支持到危机干预的全谱系对话 — OpenAI · 2026-09-24
- Paperena 基准按完整科研周期评测 AI 科学家:写、审、改 — yeewhye · 2026-09-24
- ACL'23 杰出论文:判别式语言模型为何可能比自回归更泛化 — ysu_nlp · 2026-09-24
- 10 次重跑均到关键区域却无一复现发现:全自主 agent 脆弱性实录 — rohanpaul_ai · 2026-09-24
- GTSAM 4.3发布:腿足导航、CUDA加速因子图与连续时间轨迹估计 — fdellaert · 2026-09-24