单码库跨 5 代芯片,2.3B MoE 混合 Mamba 用不到 1% 算力逼近 Llama-3.2-3B

tri_dao · x · 2026-09-23

开发者 Mayank 预训练了一个 2.3B 参数(激活 360M)的混合 Mamba-2 架构 MoE 模型 Rigel,性能距 Llama-3.2-3B 仅差几个百分点,而预训练 FLOPs 不到后者的 1%。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →