用小模型代理调参,省下万亿级 MoE 训练算力
burny_tech · x · 2026-08-25
针对万亿级 MoE 模型训练中学习率调优成本极高的问题,这篇论文提出了一种计算高效的两步超参数迁移框架。
- 核心方法:首先利用 Maximal Update Parameterization (μP) 将小模型的最佳学习率迁移至不同宽度的模型;随后建立简单的缩放定律,将学习率从短时训练外推至万亿 token 训练时长。
- 效果验证:该方法在 155B 参数 MoE 模型的预训练中表现稳定,仅需通过小规模代理模型的运行即可精准预测大规模模型的最优配置(R²=0.95),大幅消除了全量网格搜索的成本。
- 实际应用:作者利用此策略从零预训练了基础模型(总参数 155B,激活参数 17B),验证了其在极低消融成本下的预测能力。
所属事件:新框架用小模型迁移调参,大幅节省万亿 MoE 训练算力(2 条相关)→
「研究」频道最新
- GLiNER 2.5 发布:架构升级支持全文档长上下文提取 — huggingface · 2026-08-25
- 技术分析证实 stealth/ox-alpha 实为 Z.ai 的 GLM 模型 — PawelHuryn · 2026-08-25
- Nature Methods 发布 ProteinDPO 蛋白质生成模型 — BrianHie · 2026-08-25
- Thinking Machines 提出开放权重模型的安全路径 — luke_drago_ · 2026-08-25
- Headlong 实验持久化 Agent:指数退避与分层上下文 — lateinteraction · 2026-08-25
- CoRL 2026 机器人基础模型记忆研讨会征稿 — EricLengyel · 2026-08-25