2.3B 混合 Mamba 模型用不到 1% FLOPs 比肩 Llama-3.2-3B

berkeley_ai · x · 2026-09-24

加州大学伯克利团队(profjoeyg 等)发布学术低成本预训练成果 Rigel:一个 2.3B 参数的 MoE 混合 Mamba-2 模型(激活参数约 360M),性能逼近 Llama-3.2-3B,而预训练 FLOPs 用量不到其 1%。

亮点:

这项工作对「用有限预算验证新架构」的学术研究路线有参考价值。

所属事件:伯克利发布 2.3B 混合 Mamba MoE 模型,以不到 1% 算力逼近 Llama-3.2-3B(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →