为何 Adam 不如标准梯度下降?论文揭示其破坏规范对称性致 40% 误差
burny_tech · x · 2026-08-09
一篇 arXiv 新预印本论文深入对比了 Adam 与标准梯度下降(GD)在相同损失景观下的行为差异。
- 核心发现:GD 在分解模型中天然遵循规范对称性,能平滑地找到低秩解;而 Adam 等逐坐标优化器会因逐元素缩放梯度瞬间打破这种对称性。
- Transformer 表现:在 Transformer 架构中,Adam 在训练的第一步就破坏了规范等价初始化,导致单头不变性出现高达 56% 的不可逆缺口。
- 性能影响:在欠定矩阵任务中,得益于这种对称性保留,GD 的测试误差比自适应方法低 40% 以上。
「研究」频道最新
- 新架构 RHEA:8GB 显存即可训练 10 亿参数模型 — zemondza · 2026-08-24
- 跳过 LLM 写代码老套路:自训 16M 参数模型做生成式 CAD — debreuil · 2026-08-24
- Claude 助手发现 6 维球复结构,解 60 年数学难题 — Singularitarian · 2026-08-24
- 研究揭示 AI Agent 行为:六成阅读量来自指令与笔记 — dair_ai · 2026-08-24
- Claude 自主验证 43 个数学模块,AI 攻克理论物理难题 — Tkaraletsos · 2026-08-24
- AI 假记忆:为何模型越用越错,真记忆需遗忘 — PrajwalTomar_ · 2026-08-24