M+Adam 提升低精度训练效果
AnimaAnandkumar · x · 2026-07-14
这条研究结果显示:在 **1B 参数以内**的 transformer 模型上,以及从 **1x 到 8x Chinchilla** 的训练预算范围内,**M+Adam** 在低精度 master-weight 设置下都能稳定优于 **AdamW**。 核心结论: - 收益在 **更激进的低精度训练** 场景里最大。 - 低精度训练需要优化器的更新几何与浮点网格匹配。 - M+Adam 通过一次优化步骤里同时做 **乘性更新** 和 **加性更新**,把“尺度感知的推进”和“局部修正”结合起来。 - 该方法支持 **端到端低精度训练**,不再依赖更高精度的 master weights。
所属事件:M+Adam 优化器提升低精度训练效果(2 条相关)→
「研究」频道最新
- 人形机器人演示多是在测整机能力,不是生产作业 — BradPorter_ · 2026-07-21
- RLM 论文称,任务泛化更多来自 harness 而非 Transformer — a1zhang · 2026-07-21
- Fast-FoundationStereo 把零样本双目匹配推到实时速度 — rsasaki0109 · 2026-07-21
- 昆仑万维发布 Matrix-Game 3.5,主打实时世界模型生成 — 智东西 · 2026-07-21
- DiFA 让扩散模型推理对齐前向统计,生成质量更高 — cn-scut · 2026-07-21
- 微软研究院把 LLM Judge 变 Coach,优于 rubric RL — MicrosoftResearch · 2026-07-21