ICLR26 论文提出「解释等价」:不解读网络也能判断算法是否相同
burny_tech · x · 2026-09-18
Alan Sun 与 Mariya Toneva 的论文《Tracking Equivalent Mechanistic Interpretations Across Neural Networks》(arXiv:2603.30002,ICLR26)研究机械可解释性中的基础问题:能否在完全解读任一网络之前,判断两个神经网络是否实现了相同的底层算法?
- 核心概念是「interpretive equivalence」(解释等价):两个解释等价,当且仅当它们所有可能的实现也等价。
- 方法:将高层机制视为与之一致的一族模型实现,通过对行为无关组件做因果干预生成替代实现,再比较所得表示空间。
- 在 causal-abstraction 假设下,推导出表示距离与解释距离之间的上下界,在电路、因果抽象与表示几何之间建立形式化桥梁。
- 在 Transformer 模型上做了案例研究,提出 Congruity 测试,为 MI 的严格评估与自动化、可泛化的解释方法奠定基础。
「研究」频道最新
- SceneAgent:将 3D 采集自动转为物理仿真场景,供机器人策略训练 — hankyang94 · 2026-09-18
- LAX 发布:自然数学语言直连 Lean,可形式化复杂度类结果 — lpachter · 2026-09-18
- Fari 研究院新论文:失准 AI 无需逃逸,说服监督者即可 — DG_Rand · 2026-09-18
- 生物医学世界模型框架提出:虚拟试药、逆向干预设计与序贯规划 — marinkazitnik · 2026-09-18
- LeanReact 0.1 发布:用 Lean 类型系统表达组合正确的前端组件 — hargup13 · 2026-09-18
- Cell 刊文提出「生物医学世界模型」框架:从分子到患者的虚拟模拟 — marinkazitnik · 2026-09-18