长上下文训练或削弱参数记忆,引发丰富性悖论
DanielKhashabi · x · 2026-08-18
论文提出“信息丰富性悖论”:训练时如果上下文中包含大量相关信息,模型编码参数化知识的动力会减弱,从而更依赖上下文。研究表明,在预训练中增加上下文长度仅在达到中间最优值前能提升性能,随后性能会下降。随着上下文增长,优化重心从 FFNs 转向注意力机制,改变了模型的知识表征方式。
所属事件:研究提出“信息丰富性悖论”:长上下文训练削弱参数记忆(2 条相关)→
「研究」频道最新
- OpenAI 为何猛攻数学?网友:因为数学最适合 RL 可验证奖励 — burny_tech · 2026-09-22
- 本周必读论文清单:递归自改进、世界模型与 KV 缓存压缩 — TheTuringPost · 2026-09-22
- Meta 开源 A-MLE:用 LLM Agent 自动化广告排序模型实验 — rohanpaul_ai · 2026-09-22
- Blind RSA 与 Privacy Pass:验证码规模化攻击的实际威胁模型分析 — matthew_d_green · 2026-09-22
- Harvard+MIT 论文:让金融 AI 用回归测试安全地从错误中学习 — rohanpaul_ai · 2026-09-22
- 限制单人投稿量没用?会议统计:量大多来自低产作者 — furongh · 2026-09-22