外卖巨头造前沿模型:美团 LongCat 的 N-gram 注意力与国产算力突围

bookwormengr · x · 2026-09-21

一篇深度长文剖析了美团 LongCat 实验室的崛起:LongCat 2.0 是首个已知在华为 910C 上训练的模型,很可能使用 CloudMatrix 384 超级节点(每节点 384 颗 NPU,对比 Nvidia NVL72 机架的 72 颗),官方称共动用约 5 万颗 ASIC。

作者认为外界关注模型本身,却低估了 LongCat 与华为工程的巧思:用「更弱」的器件、降低对 HBM 的依赖并发明新架构来突破美国出口管制。LongCat 团队展示了大胆的架构押注—— mastered 难训练的稀疏 MoE、发明了更好的注意力机制,并独立研发了 N-gram 稀疏化这条新的稀疏轴。推文还指出这展示了中国 AI 生态协同作战的能力,是 Uber、DoorDash 等西方同行难以想象的。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →