AMD 开源 160 亿 MoE 模型,完全公开训练流水线
QuixiAI · x · 2026-07-28
AMD 发布了 Instella-MoE,这是其首个“完全开放”的 MoE 语言模型。
- 规模:总参数 160 亿,每个 token 仅激活 28 亿 参数。
- 训练:从零开始在 AMD Instinct MI300X / MI325X GPU 上训练,使用 AMD-Primus 和 Miles 框架。
- 开放内容:不仅开放权重,还公开了 端到端训练流水线,包括预训练到 RL 的各阶段 checkpoint、训练配方、配置、数据混合与训练/推理代码。
- 效果:AMD 表示它在同类完全开放模型中达到了该尺度下的领先表现。
- 配图信息:附图是基座模型和后训练/RL 模型的对比图,Instella-MoE 在同类开源/开放模型里排名靠前。
「Infra」频道最新
- 美国一半服务器可能藏在小房间里,不在巨型数据中心 — aronchick · 2026-07-28
- 摩根士丹利称 AI 存储价格或在 2026 年四季度见顶 — SumitGup · 2026-07-28
- Iota 称 Orion-16B 正在三大洲异构算力上实时训练 — markjeffrey · 2026-07-28
- Databricks 主打 AI 支出治理,称 token 消耗已跑赢价值 — matei_zaharia · 2026-07-28
- 两张 H200 跑编码模型怎么配,4 到 10 个并发用户怎么服 — redblood252 · 2026-07-28
- AMD、Intel 与设备需求成最新半导体播客主题 — BenBajarin · 2026-07-28