新论文用“排列对称性”解释神经网络的骤变学习与缩放律
CatAstro_Piyush · x · 2026-08-18
一项新研究(arXiv:2608.13335)试图解释为何所有神经网络模型都会出现“骤变学习”和遵循“缩放律”现象。研究指出,根本原因在于神经网络的排列对称性。
核心观点:
- 在小权重初始化时,排列对称性将训练动力学限制为仅依赖于特定于架构的“结构矩阵 A”。
- 无论是感知机、注意力层、专家混合 (MoE) 还是卷积层,都可以统一归约为这一最小模型下的不同 A 矩阵。
- 训练动力学在“序参数” M=WW^T 上闭合,并简化为 Lotka-Volterra 方程,其模式会逐个开启。
- 初始权重越小,开启时间间隔越大,导致损失函数在长时间平台期后突然下降;当许多模式未分辨时,这些事件合并为平滑的幂律缩放。
「研究」频道最新
- TACL 期刊招募审稿人,需博士及高引用 — EhudReiter · 2026-08-24
- 研究员热议:超置等新论文让人梦回 2019 年的黄金时代 — _xjdr · 2026-08-24
- Biomni:可自主执行生物医学研究工作流的通用 AI Agent — bravo_abad · 2026-08-24
- 数据过滤是零权重混合特例,分布基础待解 — SinclairWang1 · 2026-08-24
- Anthropic 公开 2026 智能体对齐失败案例研究 — voooooogel · 2026-08-24
- Hugging Face 用夜间 Agent 自动挖掘 arXiv 上的失传开源模型 — NielsRogge · 2026-08-24