纯CPU跑满671B大模型:国产超算16节点吞吐量比肩80张GPU

新智元 · wechat · 2026-08-07

清程极智与国产超算“灵晟”联合发布了纯 CPU 的 MoE 模型分布式推理方案。通过深度的软硬件协同优化,仅需 16 个超算节点即可流畅运行 DeepSeek-V3/R1-671B 模型。

在 batchsize=2048 的并发条件下,该方案的输出吞吐量能与 80 张主流 GPU 集群相当。硬件层面,“灵晟”超算依赖自研的 LX2 CPU,其集成了片上高带宽内存提供 TB 级带宽,配合“灵启”微秒级低时延网络,打破了传统 CPU 的通信与访存瓶颈。

软件层面,技术团队针对国产 CPU 架构重构了底层算子,并实施了 TP/PP/EP/DP 多层次混合并行策略(如大规模 EP256 专家并行),结合 MTP(多 Token 预测)技术大幅提升了单请求的生成速率。这一落地标志着国产算力正从单纯的硬件指标比拼,转向提供高性价比、可商用的“Token 工厂”量产能力。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →