Matryoshka Attribution 用梯度下降做归因,登顶可解释性基准
stanfordnlp · x · 2026-09-26
Noah Goodman 转发并评论了新论文 Matryoshka Attribution:这是一种新的归因方法,用梯度下降来定位神经网络中负责某一行为的部分,而不是传统的人工搜索回路。
在 Mechanistic Interpretability Benchmark 上,MAttr 以大幅优势排名第一,得分是第二名的 2.9 倍。
所属事件:斯坦福提出 Matryoshka Attribution 归因法登顶可解释性基准(2 条相关)→
「研究」频道最新
- Szegedy:AI 加速科学发现才是真正的价值所在 — ChrSzegedy · 2026-09-26
- Anthropic 官宣:Claude 突破 N=4 理论九圈散射振幅计算 — ctjlewis · 2026-09-26
- AI 预言家:仅看训练数据即可提前预测模型是否会出现欺骗等失对齐 — tomekkorbak · 2026-09-26
- 数学「考古」:Calegari 追溯 AI 证明 ζ(5) 无理性的思想源头 — ctjlewis · 2026-09-26
- 研究称2层循环网络在同等算力下比肩32层前馈基线 — mike64_t · 2026-09-26
- Socher 新书《The Eureka Machine》:AI 是开启科学发现新时代的钥匙 — RichardSocher · 2026-09-26