Information Abundance Paradox: Long-Context Training Undermines Parametric Knowledge
Arda Uzunoglu, Benjamin van Durme, Daniel Khashabi
cs.CL, cs.AI
2026-08-13
训练上下文越长,模型越靠查上下文而非调记忆;任务理解在约 2K tokens 后开始下降,去掉上下文就变脆。
现在做大模型,上下文窗口越拉越长,4K、8K、128K 往上堆,背后有个默认假设:训练时见到的上下文越长、信息越丰富,对模型只会有好处。这篇论文(Uzunoglu、van Durme、Khashabi)直接质疑这个假设。
线索来自工业界已经发布的模型:Phi-3 的 128K 版本在 few-shot、zero-shot 上系统性输给自己的 4K 版本,OLMo 3 的 65K 版本同样输给 8K 版本。这不能用数据质量搪塞过去,而指向一个更根本的问题:上下文长度本身改变了模型「学什么」。
核心概念叫「信息富裕悖论」(Information Abundance Paradox):当任务相关信息直接出现在训练上下文里,模型靠「查上下文」就能压低 loss,没必要再把它存进权重。于是学习模式从「参数化内化」(parametric internalization,把知识写进网络参数)滑向「上下文化」(contextualization,学会去用上下文里的证据)。
为了验证,论文设计了两类实验。预训练侧,用 Llama-2 架构从 20M 训到 750M 参数,在 10B tokens 的 Project Gutenberg 上训练,上下文窗口从 512 一路扫到 32768,再看语言建模、SuperGLUE 和闭卷选择题(ARC、CommonsenseQA、PIQA)。SFT 侧,给 Qwen3-0.6B 到 14B 套 LoRA,在 MMLU-Pro 的健康、经济、法律、心理四个领域做微调,固定给 n=8 篇文档的预算,只改其中跟任务相关的文档数 k ∈ {0,4,8},然后分别在三种测试条件下看效果:上下文支持正确答案、上下文支持错误答案(误导)、完全没有上下文。
机制上,论文从三处下手:用训练梯度范数当「求解复杂度」的代理,看上下文变长是否让解变简单;追踪 FFN(前馈网络,常被认为存事实知识)和自注意力之间的梯度压力分配;以及看推理时注意力是否真的更频繁地投向上下文 token。
预训练的关键结果是条倒 U 曲线:SuperGLUE 和闭卷选择题在约 2048 tokens 处达到峰值,之后窗口再拉长,成绩持续往下掉;语言建模的峰值晚一些,在约 8192 tokens,过了同样回落。
| 指标 | 峰值上下文 | 之后 |
| SuperGLUE / 闭卷 MCQA | 2048 tokens | 持续下降 |
| 语言建模 | 8192 tokens | 持续下降 |
SFT 侧把代价看得更清楚。把相关文档 k 从 0 加到 8,模型在有支持性上下文时确实变强了,但代价是「没有上下文」时的准确率显著下降,而且面对误导性上下文时更容易被带跑。论文把这叫「上下文成瘾」(context addiction):训练时上下文越足,模型越离不开它。
机制证据三者互相咬合。在会「上瘾」的合成任务上,训练梯度范数随上下文变长而下降,说明上下文提供了更简单的解;FFN 对自注意力的梯度比在 20 组 SFT 对比里有 19 组显著下降、预训练所有规模也成立,说明优化压力确实从「存知识的 FFN」转向了「路由上下文的注意力」;推理时,这些模型把更多注意力投向上下文 token,集中在中层。最有说服力的是模块受限微调:只更新 FFN,模型在没有上下文时更稳、被误导时掉得更少;只更新注意力,有上下文时更强但更扛不住误导。这给了「FFN 管记忆、注意力管上下文」一个因果层面的支持,而不只是相关性。
这篇直接戳破了「上下文越长越好」这条直觉。对从业者,它的潜台词很具体:如果你的模型上线后要在「没有上下文」或「上下文可能被污染」的场景里用,那么在 SFT 阶段一股脑塞相关文档,可能正在悄悄掏空它的参数知识、放大它被误导的风险。它也提醒,Phi-3、OLMo 3 那种长上下文版本表现变差,背后可能就是这条机制在起作用,不只是工程问题。
当然,它不是叫人不要做长上下文。长上下文是真能力,但它会改变模型的学习模式,不是一条可以无脑拉长的中立供给轴。
最大的局限是规模:预训练只做到 750M 参数,作者自己承认,在更大模型、更大数据、更多算力下,拐点在哪、掉多狠,都还没验证。其次,实验不是 FLOP 对齐的,更长的窗口本身要付更高的二次方注意力代价,这个混淆因素没有完全排除。预训练数据只用了一个 Project Gutenberg 子集,SFT 只覆盖四个 MMLU-Pro 领域,架构也只测了 Llama-2 和 Qwen3 两家。把这些合起来看,「2K 是最优」这个具体数字更像是在这套特定设置下的结论,不该被当成普适规律直接搬走。