拆解黑盒新思路:不到1%数据即可从权重直接提取大模型任务回路

量子位 · wechat · 2026-08-14

至知创新研究院联合牛津、斯坦福、清华等机构提出一种名为稀疏权重分解(SWD)的大模型机制可解释性新方法。

传统方法(如Transcoder)为了理解模型内部机制,往往需要训练一个新的替代网络,这带来了高昂的数据和计算成本,且容易引入替换误差。SWD则另辟蹊径,直接从预训练模型的现有稠密权重中“拆”出可独立干预的稀疏瓶颈单元,无需额外训练替代网络。

论文核心亮点:

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →