Muon优化器新突破:Hyperball实现20-30%预训练加速
teortaxesTex · x · 2026-08-11
一项新研究提出了名为 Hyperball 的优化器封装方法,旨在解决 Muon 等基于矩阵的优化器在模型规模扩大时性能提升递减的问题。
- 核心机制:Hyperball 将权重矩阵及其优化器更新的 Frobenius 范数固定为常数。
- 实验效果:在最高 1.2B 参数的 Qwen3 风格模型上,相比使用标准权重衰减的基线,实现了 20-30% 的 token 等效加速。
- 额外优势:该方法还改善了跨不同宽度和深度的学习率迁移性能。
- 理论支撑:研究基于已有理论,指出权重衰减训练会导致仅依赖于训练超参数的平衡权重范数,从而决定权重矩阵方向变化的角学习率。
所属事件:Hyperball优化器突破Muon瓶颈实现30%加速(2 条相关)→
「研究」频道最新
- Kimi K3 蒸馏争议:论文作者承认未证实,或为数据污染 — bookwormengr · 2026-08-12
- RefineAny3D:用微调VLM优化单目3D检测 — kwangmoo_yi · 2026-08-12
- 表格 ML 难题:分类变量何时应单独建模? — mariofilhoml · 2026-08-12
- 前沿大模型缺乏心智理论,开发者呼吁引入RL训练 — lateinteraction · 2026-08-12
- 伯克利等提出MLS-Bench:AI Agent能搞科研,但还提不出新方法 — 机器之心 · 2026-08-12
- AI分析师Agent失败分析:57%因锚定错误假设,Gemini与Grok差异显著 — ArtificialAnlys · 2026-08-12