拆解 LLM Prefill 与 Decode 分离:硬件不同结果迥异

vllm_project · x · 2026-08-29

基于 vLLM + NIXL 的开源基准测试显示:在普通硬件上拆分 LLM 的 Prefill(预填充)与 Decode(解码)阶段弊大于利。跨 GPU 无高速链路拆分时,Time-to-First-Token 变慢 5.5 倍;CPU Prefill 比 GPU 慢约 100 倍。研究指出,只有在前沿实验室规模(NVLink/RDMA + 高并发)下,这种分离架构才因成本优势而具备可行性。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →