新框架用小模型迁移调参,大幅节省万亿 MoE 训练算力

一篇新论文针对万亿级混合专家(MoE)模型训练中学习率调优成本极高的问题,提出计算高效的两步超参数迁移框架。该方法基于 Maximal Update Parametrization,利用跨模型宽度和 Token 预算的缩放规律预测最优学习率,无需昂贵搜索即可高效预训练,用小模型代理调参即可省下可观算力。

2026-08-24 ~ 2026-08-25 · 2 条相关