博士论文证最优增量学习不可行,两篇新论文解释预训练为何绕开它
khademinori · x · 2026-09-25
作者以自己博士论文的结论(最优 class-incremental 学习在理论上不可行)为背景,推荐两篇新论文,解释预训练模型为何能绕过这一不可行性。
- 第一篇证明 fine-tuning 会侵蚀泛化裕度(margin),且侵蚀速率随学习率增大而增长。
- 第二篇以闭式解刻画了顺序训练的交叉熵头部中 L2 正则化导致的每阶段偏移,并提出 gauge anchoring 这一以可忽略代价移除该偏移的约束。
- 两项结果均在预先注册的协议下与精确求解对照验证。
所属事件:两篇预训练表示研究入选 NeurIPS,破解增量学习不可行困局(2 条相关)→
「研究」频道最新
- Vite 核心成员实测揭 oj 基准缺陷:内存或被高估超 100MB — cnakazawa · 2026-09-25
- DeepMind 论文:一条误导性提示可让 Coding Agent 成绩暴跌 46.7% — dair_ai · 2026-09-25
- NeurIPS 新论文:自利自复制智能体可从零演化出合作 — maxhkw · 2026-09-25
- 连续扩散语言模型 RePlaid 被 NeurIPS 2026 接收,可与离散扩散同台竞争 — ArashVahdat · 2026-09-25
- AAAI 2027 第一阶段评审结果出炉 — CSProfKGD · 2026-09-25
- NeurIPS AC 神预言:rebuttal 还没开始就写好 meta-review — BlackHC · 2026-09-25