斯坦福团队推出 Matryoshka Attribution,可解释性基准夺榜首
ChrisGPotts · x · 2026-09-24
新论文 Matryoshka Attribution(MAttr) 提出一种新的模型归因方法:用梯度下降找出神经网络中哪些部分负责某个行为,并学习跨稀疏度嵌套排序模型组件,直接以干预性能为优化目标。
结果上,MAttr 在 Mechanistic Interpretability Benchmark(MIB)上以2.9 倍于第二名的差距位列第一,且能跨任务迁移、可扩展到参数归因。论文由 Chris Potts、Dan Jurafsky、Noah Goodman 等合作完成。
所属事件:斯坦福发布 MAttr 归因方法,2.9 倍优势登顶机制可解释性基准(7 条相关)→
「研究」频道最新
- OpenAI 联合 80+ 临床医生发布开源心理健康基准 MentalHealthBench — OpenAI · 2026-09-24
- MentalHealthBench 覆盖日常支持到危机干预的全谱系对话 — OpenAI · 2026-09-24
- Paperena 基准按完整科研周期评测 AI 科学家:写、审、改 — yeewhye · 2026-09-24
- ACL'23 杰出论文:判别式语言模型为何可能比自回归更泛化 — ysu_nlp · 2026-09-24
- 10 次重跑均到关键区域却无一复现发现:全自主 agent 脆弱性实录 — rohanpaul_ai · 2026-09-24
- GTSAM 4.3发布:腿足导航、CUDA加速因子图与连续时间轨迹估计 — fdellaert · 2026-09-24