How Do Language Models Choose Between Context and Memory?
Benjamin Shih, John Winnicki, Arianna Cao
cs.LG, cs.CL
2026-09-01
斯坦福在 Qwen、Llama、OLMo 上对换权威激活坐标,任务内复现 30%–68% 的来源选择偏移;颜色任务方向搬到材料任务只关掉 9% 的权威差距,本地方向能关掉 57%。
上下文和参数记忆打架时,模型听谁的,已经能被读出来,也能被 activation steering 推一把。Minder 等人找到过一维的「上下文敏感旋钮」,Zhao 等人用稀疏特征做转向,还有工作用门控在 RAG 冲突里选源。能转向、能解码,不等于模型自己平时就走这条方向。一条向量可能很好推,却不在未编辑模型真正用来做选择的计算里;跨任务能不能复用,又是另一回事。
斯坦福这篇把三件事拆开测:权威相关方向是否在任务内被因果使用,方向能否跨任务转移,以及「跨任务还能解码」是否等于「跨任务还能干预行为」。
设定很干净。上下文写一条假事实,参数记忆支持真事实,只改权威措辞。颜色任务里,高权威说「草绝对是紫色的」,低权威说「有未经证实的传言说草是紫色的」。模型在 12 种颜色的 next-token 分数上做选择。权威方向不从冲突样本里学,从「上下文和记忆说同一答案」的 agreement prompt 里估:每层 residual 上高权威均值减低权威均值,再归一化。
真正的因果测试不是加一个 αs 去推,是 activation interchange:在配对的高/低权威 prompt 之间,只把权威方向上的标量坐标对换,正交残差原样保留,并在 8 个后层反复做,下游照常前向。效果用 gap closure 衡量,即两次对换合起来关掉了多少自然的高-低权威差距。对照是随机方向,以及去掉权威分量后、匹配残差协方差的方向。
模型是冻结的指令微调权重:Qwen2.5-7B/3B、Llama-3.1-8B、OLMo-2-7B,没有微调。干预层在 Qwen2.5-7B 上选定,其他模型按相对深度对齐。另有材料任务(物体由什么制成,词表与颜色不相交)和州/国家事实任务。权威线索还测了措辞、来源可信度、引用证据、共识,以及几乎无效的第一人称自信作为空基线。
颜色任务里,对换权威坐标关掉自然差距的比例是:Qwen 68%(bootstrap 95% CI [61, 75]),Llama 56%([48, 64]),OLMo 30%([25, 37])。随机对换接近 0。相对最强协方差对照,Qwen 高出 18 倍,Llama 2.9 倍,OLMo 2.2 倍。Qwen 上 mediation index 为 0.35,协方差对照均值 0.017、最大 0.049。
加性转向也通。Qwen2.5-7B 第 21 层,朝权威方向推,低权威 prompt 的跟上下文概率从 0.14 到 0.76;反向推,高权威从 0.90 到 0.06。上下文支持的颜色在 76% 样本上拿到最大 logit 增幅。颜色拆成不相交集合重估方向,两两余弦均值 0.96。
材料任务上记忆准确率 0.988,自然权威差距 0.560。本地方向关掉 0.574(约 57%),从颜色任务进口的方向只关掉 0.085,约等于权威差距的 9%,是本地方向效果的 14.8%。最强协方差对照关掉 0.043,进口方向只比对照高大约 0.042。
州/国家任务把「能解码」和「能干预」拆得更开。权威差距在参考 prompt 上是 0.454(国家)和 0.492(州),AUROC 0.995–1.000,编码保留 0.90–0.92。单层进口干预最大效应只有 0.014 和 0.038,表 5 里甚至落到 0.001 和 -0.008。跨域几乎完美可读,行为几乎推不动。
做 interpretability 和做冲突缓解的人,容易把「能 steer」当成「模型在用」。这篇给了一个更硬的检验:把自然出现的坐标在配对 prompt 之间对换,比往残差上加一个学来的向量更接近内源使用。
任务内,后层权威方向确实参与来源选择,Qwen 上最强;跨任务,线性方向几乎转不过去。想做一颗通用的「听上下文还是听记忆」旋钮,现有证据不支持。更接近的图景是,权威计算可能是任务相关的,共享的也许是非线性结构,各任务有各自的线性实现。
作者自己写了:材料任务样本量小,任务几何和缩放可能不同;弱转移不能排除共享非线性表示。州/国家实验是单层对换,下一步才是多层反复 interchange。泛化到更多任务之前,不能把「任务相关」说成通例。
设定本身很实验室。答案是封闭词表上的 next-token,权威是「definitely」对「unverified rumor」这类措辞,不是检索文档或工具返回。OLMo 只关掉 30%,对照优势也最弱,机制不是模型族通用开关。第一人称自信几乎无效(行为差 0.01),说明「权威」在这里更像外部来源信号,不像说话者自信。
摘要里的 9% 对应进口方向的绝对 gap closure 0.085,14.8% 是它相对本地方向 0.574 的比例。两套数字说的是同一组实验,分母不同。