用小模型代理调参,省下万亿级 MoE 训练算力

burny_tech · x · 2026-08-25

针对万亿级 MoE 模型训练中学习率调优成本极高的问题,这篇论文提出了一种计算高效的两步超参数迁移框架。

所属事件:新框架用小模型迁移调参,大幅节省万亿 MoE 训练算力(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →