残差网络超深时怎么缩放层更新?新论文给出相关权重下的初始化理论
burkov · x · 2026-09-06
burkov 解读了一篇近期论文:残差网络极深时,每层的更新必须精细缩放——缩得过小网络趋近恒等映射,过大则隐状态不稳定。此前理论假设各层权重独立,而这篇新论文针对层间存在长程相关的初始化情形建立了缩放理论:
- 正确的缩放系数取决于层间相关性衰减的速度,以及初始权重的生成方式
- 这意味着这些选择可以被视为有意义的初始化超参数,而非任意细节
- 论文还分析了超深网络在这些选择下逼近的极限:除已知两种情形(强相关层对应常微分方程、弱相关情形对应随机微分方程)外,给出了新的刻画
「研究」频道最新
- 新论文修补对比强化学习盲区:用1比特失败信号重加权InfoNCE — kastnerkyle · 2026-09-06
- NBER 研究:AI 投资自 2018 年后带来企业生产率增长 — TaniaBabina · 2026-09-06
- GNN 作者 Kipf:智能是缩小生成-验证差距的过程 — tkipf · 2026-09-06
- 模型爱乱改别人代码,CROCODIL 后训练框架可抑制过度编辑 — omarsar0 · 2026-09-06
- 阿德莱德大学 MIP:裸编码 agent 零样本导航,R2R-CE 成功率 78% — jiqizhixin · 2026-09-06
- 临床试验拖慢反馈回路,AI 制药能力被系统性削弱 — clarejtbirch · 2026-09-06