DEFT 用结构掩码做持续学习防遗忘
TheGradient · x · 2026-07-24
这条线程在讲什么
DEFT 被描述为一种用于持续学习/迁移学习的方法,目标是避免灾难性遗忘。核心思路是:先在冻结的“Core”里找出冗余神经元并合并,释放出可重新利用的容量;再通过结构性的掩码,把可训练的“Slack”与 Core 隔离开,阻止新学习反向污染旧知识。
它想解决什么问题
作者把它和以往常见方案做了对比:例如 stop-gradient、EMA teacher-student、冻结预训练编码器,或者依赖很多手调系数的 VICReg 风格损失。DEFT 的卖点是用一个更统一的结构机制,兼顾保留旧知识与吸收新任务。
所属事件:DEFT 持续学习新架构:Core-Slack 分区防遗忘(3 条相关)→
「研究」频道最新
- AI slop 已开始污染代码评审和科研署名体系 — rbhar90 · 2026-07-27
- ICML 2026 口头论文复现分数重算后仍偏中等 — profjamesevans · 2026-07-27
- 长周期智能体最终需要不可变事件日志 — sebpaquet · 2026-07-27
- Seed IQ 在 Doom II 里通关,引出 ARC-AGI 之后的评测问题 — Fit_Transition8824 · 2026-07-27
- 实测智能体数据科学工作流:代码能跑但常答错问题 — hugobowne · 2026-07-27
- 一份横跨 ML、系统、NLP 与音频的经典论文清单 — deliprao · 2026-07-27