单码库跨 5 代芯片,2.3B MoE 混合 Mamba 用不到 1% 算力逼近 Llama-3.2-3B
tri_dao · x · 2026-09-23
开发者 Mayank 预训练了一个 2.3B 参数(激活 360M)的混合 Mamba-2 架构 MoE 模型 Rigel,性能距 Llama-3.2-3B 仅差几个百分点,而预训练 FLOPs 不到后者的 1%。
- 没有专用集群:同一次训练在 H100、A100、V100(甚至 V100)和 TPU v5p/v6e 之间跳转完成,全部基于单一代码库。
- Tri Dao 转发点赞,称 Mayank 付出了巨大工作量,让预训练跑通三代 Nvidia GPU 和两代 TPU,这么小的模型做出这样的效果非常出色。
- 对低资源预训练和异构硬件训练感兴趣的读者可看原帖线程。
「Infra」频道最新
- fmgo 开源:在 Go 中调用苹果端侧 Foundation Models,免 CGO 免 Swift — Super_Run_8466 · 2026-09-23
- 华为发布 Peerium 计算架构:百万级处理器如同一台计算机 — Dr_Singularity · 2026-09-23
- Grok 解析 DeepSeek 训练:为何用 DualPipe+ZeRO-1 而非 ZeRO-3 — TheZachMueller · 2026-09-23
- Epoch AI:同等性能 AI 成本每季降 47%,降价速度史无前例 — daveholtz · 2026-09-23
- M5 Ultra 本地跑大模型实测:预填充快 4 倍,但功耗翻倍 — DigitalguyCH · 2026-09-23
- $500 收 7 台 OptiPlex 组建物理机 Agent 集群,无盘 netboot 防翻车 — colinmcnamara · 2026-09-23