MIT提出LSL框架:无需旧数据即可解决大模型灾难性遗忘
MIT · hf · 2026-10-05
MIT 研究者提出 Local Support Learning(LSL),一个解决大模型灾难性遗忘的通用后训练框架。
- 将遗忘视为各权重矩阵输入空间中的几何问题,发现梯度优化器产生的更新在保留旧能力的目标下是次优的
- LSL 在新学习阶段引入两个组件:标准权重适配器 + 门控函数,门控仅在输入激活来自当前训练分布时启用适配器,使更新局部化
- 关键难点是门控需在仅见过当前阶段数据的情况下路由所有阶段数据,解法是基于高斯混合模型(GMM)的门,其似然在远离训练数据处快速衰减,天然对旧阶段数据保持关闭
- 在最高 7B 参数的 LLM 上验证:无需访问旧数据即可在多个训练阶段保留预训练与微调能力,内存与计算高效、对超参数鲁棒且有扩展潜力
「研究」频道最新
- KAIST 提出 Pivot-SD:只蒸馏关键去噪决策,200 题超越强化学习基线 — kaist-ai · 2026-10-05
- SBERT2S1:生物医学检索编码器一次前向输出带校准概率的类型化判断 — Pritam Deka · 2026-10-05
- 同一系统测出 51.4 和 75.8,Reddit 质疑 LLM 记忆基准可信度 — Efficient_Joke3384 · 2026-10-05
- 首个大规模连续扩散语言模型 Sigma 发布,3B/8B 媲美自回归 — LucaAmb · 2026-10-05
- UniEvo-VL:多模态模型用自身反馈提升图像生成能力 — StanfordAILab · 2026-10-05
- ELLIS 图宾根研究所招聘 PI:6 年任期、免教学、经费充足 — HildeKuehne · 2026-10-05