长上下文训练反噬模型内化能力,论文揭示信息丰裕悖论
burny_tech · x · 2026-08-14
一篇新论文提出了「信息丰裕悖论」(Information Abundance Paradox),指出在长上下文预训练中,如果上下文提供了过于丰富的任务信息,模型可能会倾向于直接利用上下文,从而抑制自身对知识的参数化内化。
研究表明,随着上下文窗口的增加,模型在语言建模和理解任务上的表现会先提升后下降;在微调阶段,丰富的训练上下文虽然提升了带上下文的测试表现,但当测试时缺失上下文或存在误导信息时,模型的鲁棒性会显著降低。机制分析显示,这是因为长上下文提供了更低复杂度的解,导致梯度压力从负责参数化知识的前馈网络(FFN)转移到了注意力模块上。
「研究」频道最新
- Stanford 研究:多智能体协作成功率远低于单兵作战 — _Hao_Zhu · 2026-08-14
- NeurIPS 论文证明:AI 模型趋向“完美柏拉图表征” — seanmcdonaldxyz · 2026-08-14
- Mendel Gödel Machine:通过比较进化实现智能体自我改进 — burny_tech · 2026-08-14
- Adobe新研究:用潜在动力学推理打造强外推视频世界模型 — adobe · 2026-08-14
- Ilya 押注 TTT 架构:模型测试时动态更新权重 — burny_tech · 2026-08-14
- AI 对话机器人 DebunkBot:让 25% 用户放弃阴谋论 — stevenstrogatz · 2026-08-14