vLLM 推出实验性 AFD 插件提升 MoE 推理性能
vLLM 发布了实验性的 AFD 插件,将 MoE 推理服务中的注意力层与 FFN 层解耦。由于注意力层受 KV-cache 压力影响,而专家层负载模式不同,这种解耦能显著优化资源分配。测试数据显示,该方案使推理吞吐量提升了 11.3%,首字响应时间(TTFT)大幅降低 47%。
2026-07-24 ~ 2026-07-24 · 2 条相关
- vLLM 推出实验插件,将注意力与 FFN 服务解耦 — vllm_project · 2026-07-24
- vLLM AFD 测试显示吞吐提升 11.3%,TTFT 降低 47% — vllm_project · 2026-07-24