研究提出“信息丰富性悖论”:长上下文训练削弱参数记忆
一项新研究提出“信息丰富性悖论”:当训练上下文中包含大量相关信息时,模型缺乏将这些信息内化为参数化知识的动力,转而更依赖上下文。实验表明,预训练中增加上下文长度仅在达到中间最优值前能提升性能,超过后反而削弱模型的参数化学习能力,该现象在 10B token 规模下得到验证。
2026-08-16 ~ 2026-08-18 · 2 条相关
- 论文揭示长上下文削弱模型参数记忆 — SonglinYang4 · 2026-08-16
- 长上下文训练或削弱参数记忆,引发丰富性悖论 — DanielKhashabi · 2026-08-18