拆解黑盒新思路:不到1%数据即可从权重直接提取大模型任务回路
量子位 · wechat · 2026-08-14
至知创新研究院联合牛津、斯坦福、清华等机构提出一种名为稀疏权重分解(SWD)的大模型机制可解释性新方法。
传统方法(如Transcoder)为了理解模型内部机制,往往需要训练一个新的替代网络,这带来了高昂的数据和计算成本,且容易引入替换误差。SWD则另辟蹊径,直接从预训练模型的现有稠密权重中“拆”出可独立干预的稀疏瓶颈单元,无需额外训练替代网络。
论文核心亮点:
- 数据效率极高:在匹配替换保真度的实验中,SWD所需数据不到传统训练型基线的 1%。
- 优异的扩展性与全模型覆盖:实验成功扩展至 GPT-2 全部 48 层矩阵以及 Qwen 3.5-27B 大模型。
- Zero-data 版本:提供完全不需要校准文本的版本,直接在权重空间中最小化误差,为逐阶段追踪模型内部结构演化提供了可能。
- 精准的行为操控:提取出的稀疏路径不仅能通过因果检验(充分性与必要性),还能作为精确的“编辑手柄”,用于定向修改模型输出(如提升特定词汇的生成概率)且副作用极低。
「研究」频道最新
- AI 数学形式化加速:3周解决11个难题,2027年95%新论文可一天形式化 — RexDouglass · 2026-08-14
- 京东开源 EgoLive:1680 小时第一视角机器人数据集 — CyberRobooo · 2026-08-14
- 京东开源EgoLive数据集:1680小时第一视角视频,推动具身智能 — CyberRobooo · 2026-08-14
- AI 智能体 Specula 自动发现 249 个 bug,但专家质疑其根本方法 — tianyin_xu · 2026-08-14
- Claude 失败 650 次后打破人类纪录,攻克黎曼猜想难题 — Two Minute Papers · 2026-08-14
- ICML 新基准 NCP-Bench:最强模型 20 轮后叙事一致性仅 42% — arnicas · 2026-08-14