COLM 新论文:仅凭权重数据解析 MLP 神经元在词表空间的作用方向

megamor2 · x · 2026-10-08

作者 Asaf Avrahamy 团队(含 Gur Yoav 等)在 COLM 2025 海报环节展示论文《Disentangling MLP Neuron Weights in Vocabulary Space》。

核心结论:不依赖任何激活数据,仅从模型权重本身即可提取出有意义的方向,用以解释各个 MLP 神经元在词表空间中的工作机制,为可解释性研究提供了一条纯权重视角的路径。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →