MAttr:把归因当训练目标,500 步即刷新可解释性基准 SOTA
aryaman2020 · x · 2026-09-24
作者 Aryaman 发布可解释性新方法 MAttr,核心思路是把经典归因问题转化为训练目标:
- 方法:用可微的 sigmoid top-k 算子(无需稀疏损失、无直通估计)参数化因果干预,训练时以 judge 评分为奖励做强化学习,训练过程中随机化 top-k 预算即可得到归因排序;与以往作用于表征不同,MAttr 将掩码应用于两个 checkpoint 之间的模型权重,从而把 LLM 的定性行为追溯到训练中被更新的那部分参数。
- 效果:在机制可解释性基准 MIB 上,每个子任务仅需 500 步训练即在节点级方法中达到 SOTA,logit 差显著高于基线,且找到的单元集合非常紧凑。
- 泛化性:排序并非过拟合——MIB 减法任务上学到的归因排序,迁移到 Month 模加任务仍能恢复 86% 的性能。
- 附录:还包含将 emergent misalignment 等微调行为追溯到参数增量的实验、虚拟权重的玩具模型、Vision Transformer 实验,以及与单步 Integrated Gradients 的理论联系,回应了 "Impossibility Theorems" 论文对直接优化归因的号召。
所属事件:斯坦福发布 MAttr 归因方法,2.9 倍优势登顶机制可解释性基准(7 条相关)→
「研究」频道最新
- OpenAI 联合 80+ 临床医生发布开源心理健康基准 MentalHealthBench — OpenAI · 2026-09-24
- MentalHealthBench 覆盖日常支持到危机干预的全谱系对话 — OpenAI · 2026-09-24
- Paperena 基准按完整科研周期评测 AI 科学家:写、审、改 — yeewhye · 2026-09-24
- ACL'23 杰出论文:判别式语言模型为何可能比自回归更泛化 — ysu_nlp · 2026-09-24
- 10 次重跑均到关键区域却无一复现发现:全自主 agent 脆弱性实录 — rohanpaul_ai · 2026-09-24
- GTSAM 4.3发布:腿足导航、CUDA加速因子图与连续时间轨迹估计 — fdellaert · 2026-09-24