新论文:从张量积表示统一推导四种主流可解释性方法
tallinzen · x · 2026-09-05
研究者 EnyanZhang 发布新论文,试图为机制可解释性领域提供统一理论图景。
- 机制可解释性已发展出大量探测与干预模型内部表示的方法,但缺乏统一框架
- 论文证明四种流行的可解释性方法都可以从同一个表示假设——张量积表示(Tensor Product Representations, TPRs)——推导出来
- 这为「 probing 和 intervention 方法之间是什么关系」给出了一个理论答案
「研究」频道最新
- 研究称测试时推理时代 Chinchilla 20 token/参数是最优比已失效 — josh_wills · 2026-09-05
- MultiMDM:让掩码扩散语言模型「先打草稿」实现少步生成 — QuanquanGu · 2026-09-05
- Google DeepMind 推出免费在线书《How To Scale Your Model》讲透 TPU 上 LLM 扩展 — goyal__pramod · 2026-09-05
- 开发者优化 MoE 内核:BF16 提速 1.2 倍,MXFP8 提速 1.6 倍 — retr0jirachi · 2026-09-05
- 数学家 Kevin Buzzard 独立验证 Anthropic 的 FLT Lean 证明:确实成立 — AlexKontorovich · 2026-09-05
- Prime Intellect 用 NIXL 把万亿参数 RL 权重同步从 86 秒压到 4 秒 — samsja19 · 2026-09-05