伯克利发布 2.3B 混合 Mamba MoE 模型,以不到 1% 算力逼近 Llama-3.2-3B
加州大学伯克利团队(profjoeyg 等)发布低成本预训练成果 Rigel:一个 2.3B 参数、激活约 360M 的 MoE 混合 Mamba-2 架构模型,性能距 Llama-3.2-3B 仅差几个百分点,而预训练 FLOPs 不到对方的 1%。该工作以单一代码库跨五代芯片完成训练,展示了混合架构与稀疏激活在低成本预训练上的潜力。
2026-09-23 ~ 2026-09-24 · 2 条相关
- 单码库跨 5 代芯片,2.3B MoE 混合 Mamba 用不到 1% 算力逼近 Llama-3.2-3B — tri_dao · 2026-09-23
- 2.3B 混合 Mamba 模型用不到 1% FLOPs 比肩 Llama-3.2-3B — berkeley_ai · 2026-09-24