「分片就是传输」:青稞 AI 突破 2M 上下文显存瓶颈

青稞AI · wechat · 2026-08-30

MindLab 上线 Macaron-V1 后,发现 2M 上下文服务在高并发下 GPU 算力未满、显存先饱和:单 rank 仅剩约 117 万 token 的 KV 容量,20–40 并发即排队,约 70% 时间耗在等待。团队不愿截断或摘要压缩历史(认为完整记忆对 Agent 质量不可妥协),沿请求生命周期做了三层优化:

核心创新是 Page-Level 2D Resharding:prefill 按层切、decode 按页切,两个维度正交。直觉做法先整段传输再切分,导致每个 rank 收到 4 倍数据、3/4 传完即弃。团队发现 RDMA 引擎(Mooncake)与 DCP 本都以页为单位,于是把分片融进传输本身:发送前按页号过滤,落地即在最终槽位,传输量降为 1/4。配套 size-broadcast、前缀长度共识等一致性协议防止多 rank 死锁。

生产实测:同样硬件从 20–40 并发排队提升到稳定承载 100+ 并发,峰值解码吞吐从约 800 升至 1800 token/s。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →