vLLM 发布实验性 AFD 插件提升 MoE 推理性能

vLLM 联合多家机构推出实验性的 AFD 插件,将 MoE 推理中的注意力层与 FFN 层服务解耦。由于两者的负载模式不同,拆分服务能有效优化资源分配。测试数据显示,该方案使吞吐量提升 11.3%,首字延迟(TTFT)降低 47%,显著提升了 MoE 模型的服务效率。

2026-07-24 ~ 2026-07-25 · 3 条相关

另有 1 条近重复转述:AccBalanced