论文提出 MoE 模型高效超参数迁移框架
kakaocorp · hf · 2026-08-24
该论文提出了一个两步超参数迁移框架,用于预测大规模混合专家模型的最优学习率。方法通过跨模型宽度和 Token 预算的缩放规律来实现预测,从而在不进行昂贵搜索的情况下实现高效的预训练。
「Infra」频道最新
- 实战:用 RL 自我进化设计芯片,Kimi K3 跑出 87000 tps — brianryhuang · 2026-08-24
- FLUX.2 Klein 图像生成器发布纯 C/CUDA 移植版 — camenduru · 2026-08-24
- OpenRouter 揭晓去中心化算力供应商:含 Darkbloom 等 — toptickcrypto · 2026-08-24
- Claude Code 报错 529 服务器过载 — backpropagation6 · 2026-08-24
- Marin 535B 开源模型启动训练,将耗 2.7e24 FLOPs — DavidBennett__ · 2026-08-24
- Aquaduck 推出社区云:利用家用设备提供低成本推理 — punkyrockypocky · 2026-08-24