Matryoshka Attribution 问世,以 2.9 倍优势登顶机制可解释性基准
aryaman2020 · x · 2026-09-24
作者团队发布新论文 Matryoshka Attribution (MAttr):一种基于梯度下降的归因方法,用于找出神经网络中哪些部分负责某个行为。
- 在机制可解释性基准(Mechanistic Interpretability Benchmark)上以约 2.9 倍优势大幅领先第二名
- 核心思想是把经典归因问题转化为训练目标,直接对目标任务做梯度优化,而非依赖公理定义(回应了 "Impossibility Theorems" 论文的呼吁)
- 使用可微的 sigmoid top-k 算子参数化因果干预,训练时随机化 top-k 预算,得到一个稀疏度无关的归因排序,评测时可设任意 k
- 已应用成果:用 StrongREJECT 作奖励,将 Llama 3.1 8B 的拒绝行为追溯到 Base 与 Instruct 检查点之间约 1% 的参数差异;重置这部分权重可基本关闭拒绝行为而保留能力
所属事件:斯坦福发布 MAttr 归因方法,2.9 倍优势登顶机制可解释性基准(7 条相关)→
「研究」频道最新
- OpenAI 联合 80+ 临床医生发布开源心理健康基准 MentalHealthBench — OpenAI · 2026-09-24
- MentalHealthBench 覆盖日常支持到危机干预的全谱系对话 — OpenAI · 2026-09-24
- Paperena 基准按完整科研周期评测 AI 科学家:写、审、改 — yeewhye · 2026-09-24
- ACL'23 杰出论文:判别式语言模型为何可能比自回归更泛化 — ysu_nlp · 2026-09-24
- 10 次重跑均到关键区域却无一复现发现:全自主 agent 脆弱性实录 — rohanpaul_ai · 2026-09-24
- GTSAM 4.3发布:腿足导航、CUDA加速因子图与连续时间轨迹估计 — fdellaert · 2026-09-24