信息丰裕悖论:长上下文训练反而削弱模型参数知识

DanielKhashabi · x · 2026-08-16

约翰霍普金斯大学的研究者提出“信息丰裕悖论”:训练上下文中大量相关信息会降低模型将其参数化编码的动机,从而增加对上下文的依赖。预训练中,增加上下文窗口在语言建模、自然语言理解和闭卷多项选择上仅提升至中间最优值,之后持续下降。监督微调中,更多任务相关上下文在提供支持时提升性能,但在测试时上下文缺失或误导时鲁棒性下降。机制上,长上下文训练将梯度压力从前馈网络转移,影响参数知识存储。

所属事件:约翰霍普金斯提出「信息丰饶悖论」:长上下文训练反伤短任务(5 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →