纯CPU跑满671B大模型:国产超算16节点吞吐量比肩80张GPU
新智元 · wechat · 2026-08-07
清程极智与国产超算“灵晟”联合发布了纯 CPU 的 MoE 模型分布式推理方案。通过深度的软硬件协同优化,仅需 16 个超算节点即可流畅运行 DeepSeek-V3/R1-671B 模型。
在 batchsize=2048 的并发条件下,该方案的输出吞吐量能与 80 张主流 GPU 集群相当。硬件层面,“灵晟”超算依赖自研的 LX2 CPU,其集成了片上高带宽内存提供 TB 级带宽,配合“灵启”微秒级低时延网络,打破了传统 CPU 的通信与访存瓶颈。
软件层面,技术团队针对国产 CPU 架构重构了底层算子,并实施了 TP/PP/EP/DP 多层次混合并行策略(如大规模 EP256 专家并行),结合 MTP(多 Token 预测)技术大幅提升了单请求的生成速率。这一落地标志着国产算力正从单纯的硬件指标比拼,转向提供高性价比、可商用的“Token 工厂”量产能力。
「Infra」频道最新
- 盘点近期六大端侧小模型:覆盖隐私过滤、OCR与视频理解 — vanstriendaniel · 2026-08-07
- 盘点近期开源小模型:六大AI任务已可实现完全本地运行 — vanstriendaniel · 2026-08-07
- SpaceX 算力单兆瓦营收超 3000 万,远超 CoreWeave — shaunmmaguire · 2026-08-07
- DeepInfra 每日处理超 5000 亿 Token,推理算力需求旺盛 — patricious · 2026-08-07
- AMD ROCm 开源 Spur:Rust 编写的 AI 原生 GPU 调度器 — AnushElangovan · 2026-08-07
- Bun 1.4 canary 版大幅优化空闲 CPU 占用 — DanielLockyer · 2026-08-07