国产大模型算力底座曝光:18B 激活 MoE 训练 30T token
teortaxesTex · x · 2026-08-28
爆料显示国产模型在大规模预训练上取得进展:GLM 5.3 Flash 为 18B 激活参数的 MoE 架构,预训练数据量达 30T token;OpenPangu 2.0 Pro 拥有 505B 总参数(18B 激活),基于昇腾芯片训练。此外,MooreThreads 和 LongCat 2.0 也有百亿/千亿级 MoE 模型问世,显示出算力不再是绝对瓶颈。
「Infra」频道最新
- 设计可靠 LLM 网关:构建后端统一可信入口 — Mahmoud_Zalt · 2026-08-28
- LightGlue 推 ONNX 版:支持 TensorRT 与跨平台部署 — rsasaki0109 · 2026-08-28
- LLM 三次逃逸 VM,研究者重申沙箱需攻击面减缩 — dyn___ · 2026-08-28
- Cloudflare 工程师:如何构建 LLM 时代可扩展软件 — 新智元 · 2026-08-28
- Google/NVIDIA 联手开源项目,让 K8s 适配 LLM 推理 — SumitGup · 2026-08-28
- 澳洲能源部长:数据中心无化石燃料豁免权 — nordicinst · 2026-08-28