论文提出 Hyperball 优化器,结合 Muon 实现 20-30% 预训练加速
burny_tech · x · 2026-08-12
一篇新论文提出了名为 Hyperball 的优化器封装器,旨在解决 Muon 等矩阵优化器在模型规模扩大时性能增益缩减的问题。
核心机制:
- 传统观点认为权重衰减主要起正则化作用,但该研究指出它实际上控制了权重方向改变的速度。
- Hyperball 直接干预这一过程,通过固定权重矩阵的 Frobenius 范数并对每次更新进行归一化,使训练过程转化为在超球面上的移动。
实验效果:
- 在参数量最高达 1.2B 的 Qwen3 风格模型上,将 Hyperball 与 Muon 结合使用,相比权重衰减基线实现了 20-30% 的 token 等效加速。
- 该方法还显著改善了跨不同宽度和深度的学习率迁移效果。
所属事件:Hyperball优化器突破Muon瓶颈实现30%加速(2 条相关)→
「研究」频道最新
- GPT与Claude成功破解困扰25年的信息论难题 — weijie444 · 2026-08-12
- LLM 水印真的零影响吗?开发者呼吁开源复现与评测 — max_paperclips · 2026-08-12
- 新基准 Cultivar:专测多语言翻译模型的数据污染与鲁棒性 — QUBelfast · 2026-08-12
- Rocky Linux 创始人推出 OpenWALDO,打造可审计开源 AI 训练数据 — CackleRooster · 2026-08-12
- 图宾根研究品味获赞:多篇高质量工作引关注 — maksym_andr · 2026-08-12
- 研究揭示当代大模型仍难以准确表达概率与不确定性 — apsarathchandar · 2026-08-12