国产大模型算力底座曝光:18B 激活 MoE 训练 30T token

teortaxesTex · x · 2026-08-28

爆料显示国产模型在大规模预训练上取得进展:GLM 5.3 Flash 为 18B 激活参数的 MoE 架构,预训练数据量达 30T token;OpenPangu 2.0 Pro 拥有 505B 总参数(18B 激活),基于昇腾芯片训练。此外,MooreThreads 和 LongCat 2.0 也有百亿/千亿级 MoE 模型问世,显示出算力不再是绝对瓶颈。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →