论文提出 MoE 模型高效超参数迁移框架

kakaocorp · hf · 2026-08-24

该论文提出了一个两步超参数迁移框架,用于预测大规模混合专家模型的最优学习率。方法通过跨模型宽度和 Token 预算的缩放规律来实现预测,从而在不进行昂贵搜索的情况下实现高效的预训练。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →