vLLM 推出实验性 AFD 插件提升 MoE 推理性能

vLLM 发布了实验性的 AFD 插件,将 MoE 推理服务中的注意力层与 FFN 层解耦。由于注意力层受 KV-cache 压力影响,而专家层负载模式不同,这种解耦能显著优化资源分配。测试数据显示,该方案使推理吞吐量提升了 11.3%,首字响应时间(TTFT)大幅降低 47%。

2026-07-24 ~ 2026-07-24 · 2 条相关