Muon 正交化改用 P2P 通信降低 all-gather 开销
stochasticchasm · x · 2026-07-28
这条贴的是关于 P2P-based Muon orthogonalization 的论文截图,讲的是分布式优化器怎么降低通信和显存开销。
- 在分布式训练里,优化器通常会把参数切分到不同 data-parallel rank 上,但 Muon 的 Newton–Schulz 正交化需要在每次更新前拿到 完整参数矩阵。
- 朴素做法是在每个 rank 上都做全量 all-gather,这会带来很大的额外显存占用,并且在大规模下让通信成为瓶颈。
- 论文提出改成 点对点(P2P)通信:每个 rank 只从对应 owner rank 拉取自己本地拥有的参数分片。
- 这样可以去掉 full-parameter buffer,降低通信量,并把通信与计算按 model-chunk buffer 粒度流水化。
「Infra」频道最新
- 研究型 agent 横评 8 个股票数据 MCP,Equibles 排第一 — DanielAPO · 2026-07-28
- Kimi K3 在 Together AI 上线,首日就给出数亿级 TPM 容量 — togethercompute · 2026-07-28
- EUV 光刻底层材料电子效应加剧随机缺陷风险 — CatAstro_Piyush · 2026-07-28
- Kimi K3 报告披露 microVM 沙箱系统,专为 Agent RL 设计 — stochasticchasm · 2026-07-28
- vLLM 推出 Kimi K3 部署指南,适配 2.8T MoE 和百万上下文 — AccBalanced · 2026-07-28
- SkyPilot 称,部署 Kimi K3 需要多节点推理和完整服务栈 — skypilot_org · 2026-07-28