2026-08-19
JHU 团队固定知识、只换任务形态来测 context-memory 冲突:纯抽取几乎无伤,知识密集任务全线大跌,GPT-5.2 被高可信干扰段拉走 55 分,LLM 裁判也因参数知识误判。
Context–memory conflict 指的是提示里的上下文与模型参数中存的知识互相矛盾。此前研究几乎都在上下文问答一个场景里测:给一段文章,模型被要求只依据文章作答。结论分裂:有论文说模型固执地信自己的参数知识,也有论文说只要外部证据够有说服力,模型就会改口。
分裂的原因,这篇给出了一个干净的答案:场景本身就限定死了。上下文问答只代表任务光谱的一端,而现实中抽取、改写、文献综述这些任务对上下文知识和参数知识的要求完全不同。把所有冲突研究都塞进一个任务,结论自然对不上。
框架的核心设计是「固定知识,只动任务」。流程分四步:
任务形态全部转成四选一选择题,先写解释再给选项,这样裁判环节不受自由文本匹配的干扰。
| 设置 | 指标 | 数值 | 对照 |
| GPT-5.2, Parametric 任务 | 准确率 | NC 89.2 / HPC 33.7 / LPC 71.8 | HPC 掉 55.5 分,LPC 回弹 |
| GPT-5.2, Contextual 任务 | 准确率 | NC 与 LPC 差约 31 分 | 六个模型里最大绝对差 |
| RAG 任务(六个模型平均) | F1 | HPC 51.7 vs LPC 60.2 | LPC 高 8.5 分,无一例外 |
| Mistral-7B, Parametric + HPC(含解释) | 准确率 | 8.78(强指令) | 同设置 NC 为 46.98 |
| GPT-4o 裁判与人类标注 | Cohen's κ | 0.79 | 人类标注员之间 0.90 |
四条主线结论:
这组结果把两类从业场景的风险说清楚了。
做 RAG 应用的人:检索回来的文档与模型旧知识矛盾时,损失大小取决于你的任务是希望模型信文档、信自己,还是两头都要。指令写得再狠也压不住 HPC 级别的干扰,而简单复述关键证据是一个零成本、不用改推理机制的缓解手段,但要留意它天然偏向更长的上下文一侧。
做评测的人:凡是用 LLM 判卷、且被评测的输出可能违背模型自身认知的场合(安全测试、对抗性回答、事实性核查),judge 的参数知识就是系统性偏差源。这和「换更强模型就能解决」的方向相反:GPT-5.2 恰恰是被高可信冲突拉得最狠的那个。
从方法论讲,这套固定知识、只换任务形态的诊断框架(代码开源)可以直接搬去测自己的模型与应用。
作者自己列了三条。诊断数据部分由 LLM 编辑生成,可能带入分布偏差;编辑器与被测模型共享语言先验时会高估成绩;模型覆盖只有五个开源加一个 GPT-5.2,其他闭源前沿模型留待后续。
读下来还有几处要留意。模型集只到 14B(开源侧),复述与 rationale 的结论在更大开源模型上是否成立未验证。人工复核每模型仅 30 例、裁判对照仅 50 例,κ=0.79 这个关键数字的样本量偏小。不同模型的可信度靠 LLM 裁定,本身有主观性。论文也未给出按知识域分层的分析,牙痛、火星这类常识域的结论外推到专业域要谨慎。