Prefill-as-a-Service: KVCache of Next-Generation Models Could Go Cross-Datacenter
Ruoyu Qin, Weiran He, Yaoyu Wang, Zheming Li, Xinran Xu, Yongwei Wu, Weimin Zheng, Mingxing Zhang
cs.DC
2026-04-16
清华与Moonshot提出PrfaaS,把长未缓存Prefill卸到独立计算集群,经以太网把KVCache送到本地Decode。内部1T混合模型吞吐比同构PD高54%,P90 TTFT降64%,等成本约多15%。
Prefill-decode(PD)分离已经是大规模 LLM 推理的标配:Prefill 吃算力,Decode 吃显存带宽。Moonshot 的 Mooncake 把 KVCache 做成一等资源。按这个逻辑,Prefill 该用算力卡,Decode 该用带宽卡。NVIDIA Rubin CPX 和 Groq LPU 就是按阶段拆的芯片。
卡住的是 KVCache 传输。稠密注意力下 KV 随长度线性涨。MiniMax-M2.5 在 8×H200 上、32K 输入的 KV 吞吐约 60 Gbps,跨机房以太网吃不下,两阶段只能锁在同一张 RDMA 网里。异构卡通常按芯片和机房分开买,硬塞进同一集群还会把硬件比钉死,流量一变就有一侧闲着。
混合注意力把这笔账改了。少量 Full attention 夹大量线性或滑窗层,KV 能掉一个数量级,跨机房开始说得通。但流量仍突发、长度偏斜、前缀缓存不均、链路会抖,全部 Prefill 外置照样堵。模型把墙推薄了,系统还得挑哪些请求值得搬。
PrfaaS(Prefill-as-a-Service)只外置「未命中前缀且足够长」的 Prefill,算完的 KVCache 走普通以太网送到本地 PD 做 Decode;短请求仍走本地 Prefill。异构卡不必共享低延迟 RDMA。
混合模型有两类状态。线性注意力或 SWA 的 recurrent state 是请求级、大小固定,必须整段匹配才能复用;Full attention 的 KV 是 block 级,允许部分前缀命中。两者分 group、共享块池,再分成可复用的前缀块和传完即丢的传输块。传输用逐层流水线让计算和发送重叠,多连接 TCP 吃以太网,丢包和重传信号回传给调度器。
吞吐模型把系统拆成 PrfaaS Prefill、本地 PD-P、本地 PD-D,端到端取最慢一段并按外置比例折算。最优时两边 Prefill 同时饱和,且合计等于 Decode。对 t 和 Np/Nd 网格搜索即可。
开源模型把带宽墙量化了。32K、8×H200、SGLang v0.5.9:MiMo-V2-Flash 的 KV 吞吐 4.66 Gbps,MiniMax-M2.5 是 59.93 Gbps,约 13 倍;Qwen3.5-397B 是 8.25 Gbps,稠密 Qwen3-235B 是 33.35 Gbps,约 4 倍。Ring-2.5-1T 上 MLA 相对 GQA 约压 4.5 倍,7:1 混合比再约 8 倍,KV 内存大约省 36 倍。512 张 H200、平均未缓存 32K 时,MiniMax-M2.5 要 3.8 Tbps 出口,Qwen3 要 2.1 Tbps,Ring-2.5-1T 约 170 Gbps;把 128K 请求赶到 PrfaaS,能落到 100 Gbps 以下。
案例用内部 1T 混合模型,KDA:MLA=3:1,结构同 Kimi Linear。两集群 VPC 约 100 Gbps:PrfaaS 32×H200,本地 PD 64×H20(节点 800 Gbps RDMA),对照 96×H20 同构 PD。长度截断对数正态(µ=9.90,σ=1.00,[128, 128K]),均值约 27K;输出 1024 token,SLO 40 token/s,不含投机解码。吞吐和带宽都是实测 profile 喂进解析模型的结果。
最优 t=19.4K,约 49.6% 请求外置,外置子集均值约 44K。本地 PD 为 3 个 Prefill 实例加 5 个 Decode 实例(每实例 8 卡)。
| 部署 | Λmax (req/s) | 相对同构 | 均值 TTFT | P90 TTFT |
| PrfaaS-PD(4/3/5) | 3.24 | 1.54× | 2.22 s | 3.51 s |
| 同构 PD(9/3) | 2.11 | 1.00× | 4.44 s | 9.73 s |
| 朴素异构(4/-/8) | 2.45 | 1.16× | 1.74 s | 3.51 s |
相对同构,吞吐高 54%,P90 TTFT 低 64%,均值 TTFT 低 50%。朴素异构把 Prefill 全给 H200、Decode 全给 H20,只到 1.16×,比有调度的方案低约 25%。PrfaaS 出口平均 13 Gbps,占 100 Gbps 的 13%。等成本口径下吞吐大约多 15%。
混合注意力把单实例 KV 吞吐打到个位数 Gbps 之后,异构 PD 不必再把两种卡焊在同一张 RDMA 网上。算力集群和带宽集群可以分机房扩,长请求也不跟短请求抢同一批 Prefill 槽。
稠密 GQA 走不通。32K 上 MiniMax-M2.5 仍接近 60 Gbps 每实例,512 卡就是 Tbps 级出口。能用的前提是模型已是 KDA、SWA、GDN 这类混合结构,并且外置是选择性的。已经在跑 Mooncake 式 PD、下一模型又是混合注意力的团队,这篇更接近扩容图纸。
54% 里有一部分来自 H200 更快。调度增量更干净:相对朴素异构是 32%。等成本只多 15%,跨机房换卡在账上是渐进改进。
§4 数字全部来自 profile 加解析模型,不是双集群在真实突发流量下的端到端测量。设计里强调的拥塞和前缀抖动,结果表没有对应方差。输出钉死 1024、SLO 钉死 40 token/s,agent 增量 Prefill 更多时,最优 t 会变。
54% 没拆芯片差和系统差。15% 等成本只给约数,单价假设未公开。朴素异构的 P90 TTFT 已是 3.51 s,和 PrfaaS-PD 相同,调度主要买吞吐和均值 TTFT。逐层流水线、多连接 TCP、跨集群搬缓存都没有单独消融。内部 1T 模型和流量未公开,外部只能对照开源 Φkv 表。
论文写当前 PrfaaS 仍是计算瓶颈、带宽余量很大,更大规模还能加 Prefill 卡。Prefill 芯片再快一截,13 Gbps 余量会先被吃掉,带宽调度就会变成硬约束。