长上下文训练反噬模型内化能力,论文揭示信息丰裕悖论

burny_tech · x · 2026-08-14

一篇新论文提出了「信息丰裕悖论」(Information Abundance Paradox),指出在长上下文预训练中,如果上下文提供了过于丰富的任务信息,模型可能会倾向于直接利用上下文,从而抑制自身对知识的参数化内化。

研究表明,随着上下文窗口的增加,模型在语言建模和理解任务上的表现会先提升后下降;在微调阶段,丰富的训练上下文虽然提升了带上下文的测试表现,但当测试时缺失上下文或存在误导信息时,模型的鲁棒性会显著降低。机制分析显示,这是因为长上下文提供了更低复杂度的解,导致梯度压力从负责参数化知识的前馈网络(FFN)转移到了注意力模块上。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →