Goodfire 发布 BSF 模型可解释性新方法

Goodfire AI 联合研究者发布了名为 Block-Sparse Featurizers(BSF)的新方法,旨在提升神经网络的内部可解释性。该方法复现并拓展了结构化稀疏文献的思路,通过使用多维“块”而非单一方向来高效发现模型激活中的概念与特征。这一突破为理解 AI 模型的内部思考过程提供了更强大的工具。

2026-07-08 ~ 2026-07-09 · 3 条相关