Sparse Readout Prism:用稀疏特征解释 Logit Lens 分数

Matteo He · hf · 2026-09-04

新研究 Sparse Readout Prism 将语言模型的 readout 分解为稀疏特征,以区分 readout 本身的结构与依赖语料的 lens 伪影,为 Logit Lens 类可解释性方法提供更干净的解释框架。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →