AMD 开源 160 亿 MoE 模型,完全公开训练流水线
QuixiAI · x · 2026-07-28
AMD 发布了 Instella-MoE,这是其首个“完全开放”的 MoE 语言模型。
- 规模:总参数 160 亿,每个 token 仅激活 28 亿 参数。
- 训练:从零开始在 AMD Instinct MI300X / MI325X GPU 上训练,使用 AMD-Primus 和 Miles 框架。
- 开放内容:不仅开放权重,还公开了 端到端训练流水线,包括预训练到 RL 的各阶段 checkpoint、训练配方、配置、数据混合与训练/推理代码。
- 效果:AMD 表示它在同类完全开放模型中达到了该尺度下的领先表现。
- 配图信息:附图是基座模型和后训练/RL 模型的对比图,Instella-MoE 在同类开源/开放模型里排名靠前。
所属事件:AMD发布首款完全开源MoE大模型Instella(2 条相关)→
「Infra」频道最新
- Cloudflare CTO 入选 TIME 年度高管:为 agent 时代重建互联网 — dinasaur_404 · 2026-09-23
- Rat Stack:把应用和云写成一个类型化程序,让 AI agent 可靠地搭建部署 — samgoodwin89 · 2026-09-23
- optimAIzr:本地 CLI 找出 AI 用量浪费,支持 Claude Code 与 Codex 省钱 — stichstichstich · 2026-09-23
- 256GB 内存版 Mac Studio 二手溢价 6000 美元仍一机难求 — GabGarrett · 2026-09-23
- Ben Bajarin 解析 AI 数据中心:CPU 与内存如何限制 GPU 推理服务能力 — BenBajarin · 2026-09-23
- Epoch AI 报告:「思考」的价格正在暴跌,智能成本持续陡降 — Proper_Actuary2907 · 2026-09-23