vLLM 推出实验插件,将注意力与 FFN 服务解耦
vllm_project · x · 2026-07-24
vLLM 发布了一个实验性的 AFD 插件,面向 MoE 推理服务引入 Attention-FFN 解耦。
- 注意力层和专家/FFN 层的负载模式不同,插件把它们拆成独立服务,便于分别扩缩容。
- 对外仍保持同一套 vLLM serving 接口,不需要分叉出另一套代码库。
- 目标硬件覆盖 NVIDIA GPU 和 昇腾 NPU。
配图给出了整体架构:入口层、Attention Role、AFD Connector、FFN Role 以及相应的 runtime helpers,说明它是一个围绕 MoE serving 的服务栈改造。
所属事件:vLLM 推出实验性 AFD 插件提升 MoE 推理性能(2 条相关)→
「Infra」频道最新
- 机器人 Bob 因电池改装烧掉树莓派大脑,作者准备换 Jetson 重建 — chrismatthieu · 2026-07-24
- Vercel 让 Workflows 状态可固定到区域,AI Gateway 限制将上线 — cramforce · 2026-07-24
- 30 个开源 AI 仓库,覆盖 Agent、本地推理和自动化 — Shruti_0810 · 2026-07-24
- 1bit 量化版 Bonsai 27B 可在 16GB MacBook Air 上本地跑 — fuckAIbruhIhateCorps · 2026-07-24
- SpaceX 据称拒接 2028 年后 Falcon 9 客户,押注 Starship — BasedRaddka · 2026-07-24
- LangChain 将于 8 月 12 日讲解 agent 生产治理框架 — LangChain · 2026-07-24