长上下文训练或削弱参数记忆,引发丰富性悖论

DanielKhashabi · x · 2026-08-18

论文提出“信息丰富性悖论”:训练时如果上下文中包含大量相关信息,模型编码参数化知识的动力会减弱,从而更依赖上下文。研究表明,在预训练中增加上下文长度仅在达到中间最优值前能提升性能,随后性能会下降。随着上下文增长,优化重心从 FFNs 转向注意力机制,改变了模型的知识表征方式。

所属事件:研究提出“信息丰富性悖论”:长上下文训练削弱参数记忆(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →