Ai2 发布 Olmo-core 3:开源 MoE 训练框架,专家扩至 128 个吞吐仅降 5%
allen_ai · x · 2026-10-01
Ai2 发布 Olmo-core 3,重新设计的开源 MoE 训练系统,目标把 MoE 训练扩展到万亿参数级,同时保持计算效率。它是下一代 Olmo 的核心训练基础设施,延续 Ai2 开放全部训练工具与基础设施的承诺。
关键点:
- 基准:专家池从 8 扩到 128(每 token 仍只选 4 个专家,活跃参数保持在约 3.2B),总参数容量从 4.6B 增至 47B,训练吞吐下降不到 5%;同一套基础设施已验证超过 1 万亿总参数
- MoE 的核心难题:路由与专家协调带来的通信开销会侵蚀「每 token 只用部分参数」的效率优势,Olmo-core 3 针对此设计
- 配套 tech report 公开实验、发现与失败案例,包括「token gerrymandering」:负载均衡分数在负载更不均衡时反而可能变好
所属事件:Ai2 开源 Olmo-core 3,剑指万亿参数 MoE 训练(3 条相关)→
「Infra」频道最新
- 推荐一份 GPU 编程内部原理的宝藏学习资源 — goyal__pramod · 2026-10-02
- Gradium 发布最快 TTS:首段音频延迟仅约 50ms — mattturck · 2026-10-02
- 工程师观察:Gemini 4 Argon 正被用于跨数据中心集群优化 — rakyll · 2026-10-02
- Aleph Alpha 公开 MoE 预训练心得:16 到 512 块 B200 近线性扩展 — CatAstro_Piyush · 2026-10-02
- HBM 将吞下 22% DRAM 晶圆,内存成 AI 算力的最短板 — aronchick · 2026-10-02
- 视频解析:Google 的 AI 芯片能否击败 Nvidia? — Ill_Vegetable169 · 2026-10-02