研究提出“信息丰富性悖论”:长上下文训练削弱参数记忆

一项新研究提出“信息丰富性悖论”:当训练上下文中包含大量相关信息时,模型缺乏将这些信息内化为参数化知识的动力,转而更依赖上下文。实验表明,预训练中增加上下文长度仅在达到中间最优值前能提升性能,超过后反而削弱模型的参数化学习能力,该现象在 10B token 规模下得到验证。

2026-08-16 ~ 2026-08-18 · 2 条相关