动态权重嫁接:定位微调事实在 Transformer 中的两条检索通路

ChenhaoTan · x · 2026-10-06

arXiv 论文《Dynamic Weight Grafting》提出一种可解释性分析技术:将微调模型的部分权重子集「嫁接」回预训练模型,以定位微调新学事实(如新电影、新教皇)的存储位置。研究发现模型通过两条独立通路检索微调的关系信息:一是在处理实体 token 时(如「Zendaya」)用关系信息「丰富」残差流;二是在生成目标事实前的最后 token 位置「回忆」该信息。不同情况下两条通路可能都必需、或任一单独 suffices,「回忆」通路可被定位到具体模型组件。推文还提到相关做法:在合成文档上对基座模型做 next-token 预测微调,把权重更新直接应用到后训练模型上即可生效。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →