商汤把国产算力做成可盈利工厂
新智元 · wechat · 2026-07-19
这篇长文讲的是商汤在 WAIC 上发布的 Agentic 时代 AI 基础设施方案,核心关键词是 异构混合推理 和 Token 工厂。
文章先解释大模型推理可拆成 Prefill 和 Decode 两段:前者偏计算吞吐,后者偏显存带宽。商汤的思路是让不同类型的芯片分工:通用国产卡负责 Prefill,高端卡负责 Decode,用系统级调度、编译器、缓存和网络优化把整套链路跑顺。文中还提到,这套方案已经在真实客户场景中落地,适配了 GLM5.2、DeepSeekV4、KimiK2.7、MiniMaxM3、SenseNovaV6.7 等模型。
更关键的是商业化结果:文章称国产芯片参与的混推集群已经 实现可盈利,定义是收入覆盖折旧、摊销、机柜租赁、电费和人员服务费后仍为正;单卡 MFU 平均提升约一倍,最高提升 152%,同成本 Token 产出扩大 2.5 倍。文中还提到日均 Token 量从年初 4000 亿 增至预计 2.42 万亿,年底目标 10 万亿,并延伸到储能、电网需求响应、全国算力网、香港/沙特出海和太空算力等布局。
「Infra」频道最新
- AI 工程师必懂的 12 种 KV Cache 压缩技术一文讲透 — blaizedsouza · 2026-09-11
- 影子算力市场走向台前,Meta 对外出售过剩 GPU 算力成标志性信号 — DavidLinthicum · 2026-09-11
- Engram 随机读取不适合 SSD,CPU 内存低延迟共享或成正解 — bookwormengr · 2026-09-11
- 劝退帖:推理工程是真金白银的硬活,八成尝鲜者已悄然放弃 — abhijithneil · 2026-09-11
- Hugging Face《Ultra Scale Playbook》:GPU 集群训练 LLM 的免费技术书 — mdancho84 · 2026-09-11
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11