vLLM 发布实验性 AFD 插件提升 MoE 推理性能
vLLM 联合多家机构推出实验性的 AFD 插件,将 MoE 推理中的注意力层与 FFN 层服务解耦。由于两者的负载模式不同,拆分服务能有效优化资源分配。测试数据显示,该方案使吞吐量提升 11.3%,首字延迟(TTFT)降低 47%,显著提升了 MoE 模型的服务效率。
2026-07-24 ~ 2026-07-25 · 3 条相关
- vLLM 推出实验插件,将注意力与 FFN 服务解耦 — vllm_project · 2026-07-24
- vLLM AFD 测试显示吞吐提升 11.3%,TTFT 降低 47% — vllm_project · 2026-07-24
另有 1 条近重复转述:AccBalanced