AMD 发布首款完全开源 MoE 模型 Instella-MoE

BanghuaZ · x · 2026-07-30

AMD 推出了其首个完全开源的混合专家语言模型 Instella-MoE。该模型总参数量为 160 亿,每个 token 激活的参数仅为 28 亿。

模型基于 AMD Instinct MI300X 和 MI325X GPU 从零开始训练,结合了稀疏激活的 MoE 设计与门控多头潜在注意力、FarSkip-Collective 等架构创新。在同等规模的开源模型中取得了 SOTA 性能。

此次开源不仅包含模型权重,还提供了端到端的训练细节。此外,通过 Miles 框架进行强化学习后,其 IFEval 得分从 77.1 提升至 83.7;在推理端,SGLang 在专家并行下将首字延迟(TTFT)降低了 39.2%。

所属事件:AMD发布首款完全开源MoE大模型Instella(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →