AMD 发布首款完全开源 MoE 模型 Instella-MoE
BanghuaZ · x · 2026-07-30
AMD 推出了其首个完全开源的混合专家语言模型 Instella-MoE。该模型总参数量为 160 亿,每个 token 激活的参数仅为 28 亿。
模型基于 AMD Instinct MI300X 和 MI325X GPU 从零开始训练,结合了稀疏激活的 MoE 设计与门控多头潜在注意力、FarSkip-Collective 等架构创新。在同等规模的开源模型中取得了 SOTA 性能。
此次开源不仅包含模型权重,还提供了端到端的训练细节。此外,通过 Miles 框架进行强化学习后,其 IFEval 得分从 77.1 提升至 83.7;在推理端,SGLang 在专家并行下将首字延迟(TTFT)降低了 39.2%。
所属事件:AMD发布首款完全开源MoE大模型Instella(2 条相关)→
「模型」频道最新
- 博主实测称 Anthropic Opus 5.5 对话体验出色 — daniel_mac8 · 2026-09-23
- MachgenAI:账户余额超25美元可免费用Minimax H3 Turbo生成 — TheMoonMidas · 2026-09-23
- 研究者观察:爱晒AI吹捧自己的多是反社会行为者 — repligate · 2026-09-23
- 评Opus 5.5:语料满是摘要的摘要,一手经验最稀缺 — mimi10v3 · 2026-09-23
- Claude Opus 5.5 登 FrontierSWE 第二名,62.3% 仅次于 GPT-6 Astra — scaling01 · 2026-09-23
- Claude 修复后回归,实测者称速度明显变快 — evielync · 2026-09-23