Goodfire 提出 Block-Sparse Featurizers 可解释性方法

CSProfKGD · x · 2026-07-08

Goodfire AI 发布最新研究 Block-Sparse Featurizers(BSF),一种在模型内部高效发现概念/特征的新方法,呼应“如果模型以形状思考,我们的工具也应如此”的理念,用于机械可解释性研究。

所属事件:Goodfire 发布 BSF 模型可解释性新方法(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →