2.3B 混合 Mamba 模型用不到 1% FLOPs 比肩 Llama-3.2-3B
berkeley_ai · x · 2026-09-24
加州大学伯克利团队(profjoeyg 等)发布学术低成本预训练成果 Rigel:一个 2.3B 参数的 MoE 混合 Mamba-2 模型(激活参数约 360M),性能逼近 Llama-3.2-3B,而预训练 FLOPs 用量不到其 1%。
亮点:
- 无专用集群:训练在 H100、A100、V100(甚至 V100)和 TPU v5p/v6e 之间辗转,用同一套代码库完成,展示了在异构、零散算力上训练新架构的可行性。
- 学术界算力有限,但靠学生的创造力在能找到的任何硬件上训练创新架构。
- 团队公开寻求资源支持,希望把这项研究扩展到下一级训练规模。
这项工作对「用有限预算验证新架构」的学术研究路线有参考价值。
所属事件:伯克利发布 2.3B 混合 Mamba MoE 模型,以不到 1% 算力逼近 Llama-3.2-3B(2 条相关)→
「研究」频道最新
- OpenRSI 发布 RSI 评测基准 v0.1:千卡集群测试 AI 能否自我改进 — hhsun1 · 2026-09-24
- arXiv 论文揭秘:RoPE 空间偏置导致视频扩散模型违反物理规律 — udmrzn · 2026-09-24
- π0.5 真机制造任务消融:1 小时高质量数据胜过此前 17 小时 — DominiqueCAPaul · 2026-09-24
- UW、伯克利、MIT 等多校联合发起 OpenRSI-Index 研究计划 — LukeZettlemoyer · 2026-09-24
- 人脑 vs H100 对照账本:80B 晶体管对阵 860 亿神经元 — yaroslavvb · 2026-09-24
- 拆解 Jev 热:TypeSafe AI 获 4000 万美元种子轮,但它不是更快的 LLM — adnan_hashmi · 2026-09-24