「分片就是传输」:青稞 AI 突破 2M 上下文显存瓶颈
青稞AI · wechat · 2026-08-30
MindLab 上线 Macaron-V1 后,发现 2M 上下文服务在高并发下 GPU 算力未满、显存先饱和:单 rank 仅剩约 117 万 token 的 KV 容量,20–40 并发即排队,约 70% 时间耗在等待。团队不愿截断或摘要压缩历史(认为完整记忆对 Agent 质量不可妥协),沿请求生命周期做了三层优化:
- HiCache 分级缓存:KV 缓存分 GPU 显存/主机内存/存储三级,命中重复历史前缀即免重算 prefill,热请求 TTFT 平均 5 秒内。
- EAGLE 投机解码:复用 GLM-5.2 自带 MTP 层作草稿头,无需额外草稿模型,TPOT 从 30.8ms 降至 8.6ms,提速 3.6 倍。
- PD 分离 + CP + DCP:prefill 与 decode 分开部署,两侧分别按层(78 层分 8 rank)和按页(64 token/页,分 4 rank)切分,解码侧 KV 容量随卡数线性扩展,TPOT 仅增 5–15%。
核心创新是 Page-Level 2D Resharding:prefill 按层切、decode 按页切,两个维度正交。直觉做法先整段传输再切分,导致每个 rank 收到 4 倍数据、3/4 传完即弃。团队发现 RDMA 引擎(Mooncake)与 DCP 本都以页为单位,于是把分片融进传输本身:发送前按页号过滤,落地即在最终槽位,传输量降为 1/4。配套 size-broadcast、前缀长度共识等一致性协议防止多 rank 死锁。
生产实测:同样硬件从 20–40 并发排队提升到稳定承载 100+ 并发,峰值解码吞吐从约 800 升至 1800 token/s。
「Infra」频道最新
- OpenAI 自研 Jalapeño 芯片:能效超英伟达 GB200 — Beth_Kindig · 2026-08-30
- 开发者吐槽高通芯片难用,转投 Rockchip 成功发货 — kscottz · 2026-08-30
- 《Empire of AI》被揪出 4500 倍用水数据错误:升当成立方米 — altryne · 2026-08-30
- 社区分支支持 MiniMax H3 双 GPU 推理与实时预览 — karma3u · 2026-08-30
- 不仅要掌控模型调用,更要掌控模型层本身 — omarsar0 · 2026-08-30
- GLM 5.3 Flash 本地推理极慢,苹果硅芯片尚无优化 — CentrifugalMalaise · 2026-08-30