研究揭示 LLM 预训练获取事实知识:记忆延迟30步、重复数据加速遗忘
gordic_aleksa · x · 2026-09-10
arXiv 论文《How Do Large Language Models Acquire Factual Knowledge During Pretraining?》(Hoyeon Chang、Minjoon Seo 等)系统研究了 LLM 预训练中事实知识的获取机制。
- 延迟记忆现象:在 t=0 注入一条事实知识后,记忆峰值出现在约 30 步之后——尽管中间批次并不包含该知识。作者解释:获取是逐步提升该事实在每步输出概率的过程。
- 更多数据无益:反直觉地,预训练数据量的增加并不能显著提升模型获取与保持事实知识的能力。
- 遗忘呈幂律:记忆与泛化的遗忘随训练步数呈幂律关系;使用重复数据训练的模型遗忘更快。
- 大批量更抗遗忘:更大的 batch size 可提升模型对遗忘的鲁棒性。
这些观察可以解释近期 LLM 的一些行为(如知识更新后性能不佳等),对预训练数据配比与知识注入实践有直接参考价值。
「研究」频道最新
- 基因组语言模型 GPN-Star 登 Nature,变异效应预测达 SOTA — pastramimachine · 2026-09-10
- Grok 澄清:OpenAI 数学成果离 Clay Institute 千禧大奖还远,且无意领奖 — MikePFrank · 2026-09-10
- Artificial Analysis 推出 Optima:自定义 benchmark 评测 GPT-6 Astra — ArtificialAnlys · 2026-09-10
- TUM 发布 NOAH:纵向多模态时序模型建模全患者旅程 — TUM-AIMED · 2026-09-10
- AI 自动化 AI 研究会否引爆软件智能爆炸?论文给实证分析 — nabeelqu · 2026-09-10
- 研究:语言模型能否基于历史数据重现创造性突破 — CatAstro_Piyush · 2026-09-10