研究:Adam 优化器会破坏 Transformer 的低秩偏置
Devender Singh · hf · 2026-08-11
一篇题为《The Loss Does Not See the Basis, but Adam Does》的论文指出,在分解矩阵模型中,优化器的行为取决于规范等变性(gauge equivariance)。
研究发现,像 Adam 这样的坐标级优化方法会打破模型的低秩偏置,并在 Transformer 和传感任务中导致发散的解决方案。
「研究」频道最新
- 从复杂数学到DeepSeek架构:前沿理论与模型技术阅读清单 — ludwigABAP · 2026-08-11
- SymDiag:通过神经符号验证为 LLM 推理提供可解释诊断 — Wenyao Cui · 2026-08-11
- 解决流式对话摘要上下文丢失:新记忆框架面世 — Hyangsuk Min · 2026-08-11
- 用「手算数学题」拆解大模型上下文窗口机制 — ProfTomYeh · 2026-08-11
- DeepMind 首发多智能体架构扩展定律:盲目堆智能体反降效 — KyeGomezB · 2026-08-11
- AI设计蛋白质走向大单:Profluent与礼强达成基因编辑合作 — nathanbenaich · 2026-08-11