信息丰裕悖论:长上下文训练反而削弱模型参数知识
DanielKhashabi · x · 2026-08-16
约翰霍普金斯大学的研究者提出“信息丰裕悖论”:训练上下文中大量相关信息会降低模型将其参数化编码的动机,从而增加对上下文的依赖。预训练中,增加上下文窗口在语言建模、自然语言理解和闭卷多项选择上仅提升至中间最优值,之后持续下降。监督微调中,更多任务相关上下文在提供支持时提升性能,但在测试时上下文缺失或误导时鲁棒性下降。机制上,长上下文训练将梯度压力从前馈网络转移,影响参数知识存储。
所属事件:约翰霍普金斯提出「信息丰饶悖论」:长上下文训练反伤短任务(5 条相关)→
「模型」频道最新
- Qwen 3.8 27B编码实测胜Codex:成本仅1/3,性能更优 — tokenbender · 2026-08-16
- DeepSeek被指通过灰色测试刷分,Opus 5输出质量存疑 — teortaxesTex · 2026-08-16
- 研究:Qwen 可解释性透镜跨版本迁移实测 — imstilllearningthis · 2026-08-16
- 爆料:dots3或大量蒸馏自DeepSeek V3,多模态成绩亮眼 — teortaxesTex · 2026-08-16
- Z.ai 暂缓 GLM-5.3 开源权重,因模型意外涌现黑客能力 — Justgototheeffinmoon · 2026-08-16
- OpenAI 预览 GPT-5.6 Sol 超快模式:Cerebras 赋能提速 14 倍 — Justgototheeffinmoon · 2026-08-16