GLM 5 之后引入 per-head Muon 平衡各头更新
stochasticchasm · x · 2026-07-28
- 这条在讨论 GLM 5 之后的 per-head Muon 优化细节。
- 配图解释说:对 attention projection,不再把 Q/K/V 整个矩阵一起做 Newton–Schulz 正交化,而是按 head 维度 切分后逐个 head 处理。
- 动机是:全矩阵正交化容易让梯度或 momentum 更大的 head 主导更新方向,而 per-head 正交化能让各 head 的更新尺度更均衡。
- 实践上,这种做法据称能让大规模训练更稳定,同时因为每个 head 的块更小,Newton–Schulz 迭代的优化器开销也更低。
「研究」频道最新
- CMU 的 O-VAD 通过物体状态追踪做工业异常检测 — CarnegieMellonU · 2026-07-28
- Kimi K3 技术报告显示缩放效率较 Kimi K2 提升 2.5 倍 — stochasticchasm · 2026-07-28
- Latent Action Model 讲座将演示如何仅靠观察学会超级马里奥 — ceciletamura · 2026-07-28
- MLA 机制每百万 token 需 12GB KV,KDA 状态约 230MB — zephyr_z9 · 2026-07-28
- OpenAI 图表称 43.5% 的职业特定用法跨出本职 — soumitrashukla9 · 2026-07-28
- OpenAI 经济研究:AI 正在重排不同职业的任务 — soumitrashukla9 · 2026-07-28