LLM机制可解释性新方法:直接分解权重矩阵提取稀疏电路

CatAstro_Piyush · x · 2026-08-08

提出了一种高效的机制可解释性方法。与传统训练单独的稀疏表示不同,该方法直接将预训练LLM的权重矩阵分解为稀疏电路单元。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →