普林斯顿等提出 Hyperball 优化器,突破大模型训练瓶颈
burkov · x · 2026-08-14
普林斯顿、斯坦福和清华大学的研究团队联合发布了名为 Hyperball 的优化器封装工具。它旨在解决 Muon 等基于矩阵的优化器在模型规模扩大时性能提升递减的问题。
核心机制
- 问题根源:以往优化器的性能衰减不仅在于优化器本身,更在于权重衰减在训练中控制权重大小的方式。
- Hyperball 方案:它同时固定了权重矩阵及其优化器更新的大小(基于矩阵所有条目的欧几里得长度)。这使得学习率能够直接控制矩阵在方向上的变化,而不是通过权重衰减间接产生。
实验效果
在参数量最高达 12 亿的 Qwen3 风格模型上,结合 Hyperball 的 Muon 优化器展现出了更优异的训练效果。
「研究」频道最新
- Netflix 揭秘 LLM Judge 生产实践:每周评估数十万条推荐解释 — omarsar0 · 2026-08-24
- Nature 评论:数据溯源是自主科学的信任基石 — gabepgomes · 2026-08-24
- 新架构 RHEA:8GB 显存即可训练 10 亿参数模型 — zemondza · 2026-08-24
- 跳过 LLM 写代码老套路:自训 16M 参数模型做生成式 CAD — debreuil · 2026-08-24
- Claude 助手发现 6 维球复结构,解 60 年数学难题 — Singularitarian · 2026-08-24
- 研究揭示 AI Agent 行为:六成阅读量来自指令与笔记 — dair_ai · 2026-08-24