WeightWatcher 实验:Muon 优于 AdamW 或因减少记忆化
rasbt · x · 2026-09-19
WeightWatcher 团队发布 AdamW 与 Muon 优化器对比的新实验发现,Muon 表现更好可能源于它减少了记忆化(memorization)。
实验设置:用两种优化器训练单头 nanoGPT 模型,各跑五个种子,再用 WeightWatcher 分析权重矩阵谱与多种记忆化指标。观察到的现象:
- AdamW 的平均谱 α 值相对稳定;Muon 的 α 明显更噪,各层 ESD 差异大,使 α 难以可靠估计
- 关键发现是 Muon 训练下个别层的 α 会跌破 2——其谱/RG 理论预测该区间与病态的、样本特定的记忆化相关
即被平均掩盖的层级细节,可能正是解释两优化器泛化差异的线索。
「研究」频道最新
- GPT-6 Astra 机器人成绩是scaling突破还是工具红利?博主深度拆解 — GeorgiaChal · 2026-09-19
- 仅9.9%顶尖社会学论文提供复现包,半数材料残缺无法验证 — RexDouglass · 2026-09-19
- 贝叶斯 vs 频率学派:更新信念 vs 长期频率两种概率观 — mdancho84 · 2026-09-19
- 贝叶斯统计入门:把概率理解为信念而非频率 — mdancho84 · 2026-09-19
- 贝叶斯系列第 2 课:贝叶斯定理如何随证据更新假设概率 — mdancho84 · 2026-09-19
- 数据科学老手复盘:两年摸索才吃透贝叶斯定理的价值 — mdancho84 · 2026-09-19