大模型持续学习新思路:引入睡眠做梦机制与场景重定义

近期关于大语言模型(LLM)持续学习的讨论主要聚焦于两篇研究。一篇提出了极具科幻感的“睡眠/做梦”机制,主张模型不应在训练后被冻结;另一篇则从底层逻辑出发,重新审视了持续学习何时才真正需要参数层面的更新。这两项工作分别从机制设计和问题定义上,为解决大模型的长期演进提供了新视角。

“睡眠/做梦”式持续学习

围绕论文《Language Models Need Sleep: Learning to Self-Modify and Consolidate Memories》(作者 behrouzali 等人转述),研究者提出模型应在两种状态间周期切换:在 Active/Wake 状态下,模型持续接收新数据并快速更新部分权重;在 Sleep 状态下,模型冻结快照,整理近期经验,将脆弱的短期上下文记忆巩固为长期参数。该机制引入了一种名为 Knowledge Seeding(KS)的新型蒸馏方法,让模型在离线时通过生成式回放(即“梦境”数据)复习知识并递归式地自我改进。markk 评价这种设想颇具科幻感,同时指出论文给出的实验结果看起来相当激进。

实验评估与效果

behrouzali 提到,该研究的评估覆盖了长时程学习、持续学习、知识整合和小样本泛化等任务。概念验证显示,这种“睡眠”机制在多个数学与抽象推理基准上表现优于现有的监督微调(SFT)等方法。

持续学习何时才需要“学”

另一篇由 YutongBAI1002 转述的预印本则聚焦于问题定义。作者指出,现有 LLM 持续学习的路径(如 prompting、fine-tuning、reinforcement learning 和 context compression)常被割裂研究。如果模型能持续吸收新信息,传统清晰的 train/test(训练/测试)划分就会变得模糊。该研究将讨论推进到更基础层面:在具体场景下,究竟何时必须更新模型参数,何时仅靠上下文或其他机制就足够。

2026-07-14 ~ 2026-07-15 · 13 条相关

一手来源

另有 3 条近重复转述:SaxenaNayan · behrouz_ali · behrouz_ali