NVIDIA 详解 EPD 分离架构:多模态推理首字延迟最高提速 5 倍
NVIDIAAI · x · 2026-09-11
NVIDIA 技术博客介绍在 Dynamo 中实现 Encode-Prefill-Decode(EPD)分离,把视觉编码从 LLM 的 prefill 与 decode 阶段拆开,减少资源争抢。
关键数据:
- 图像密集、短中等输出、量化 MoE 模型的场景下,首字延迟(TTFT)最高提升 5 倍,端到端响应最高提升 7 倍
- 混合文本与多模态流量中,EPD 消除队头阻塞后,文本请求平均 TTFT 降低 42.2%,图像请求降低 30.8%
- 三种部署拓扑:聚合部署、编码器与 prefill/decode 共置 GPU、编码器独立部署在低成本 GPU 层并通过 NIXL 传输
- LLM 权重量化到 NVFP4、视觉编码器保持 BF16 时,共置 EPD 的 goodput 从 1.78x 升至 2.64x
收益取决于输入媒体负载、输出长度、模型规模精度与流量配比;decode 主导延迟或大型稠密模型时会缩小。博客附 Dynamo GitHub 复现指南,并建议配合并行媒体解码、embedding 缓存与多模态 KV 路由。
「Infra」频道最新
- OpenAI Agents API 公测上线,Cloudflare 沙箱可托管 Codex 云端 Agent — ritakozlov · 2026-09-11
- DeepSeek-V4.1-Flash 上线 Fireworks:552B MoE 主打编码与智能体 — lqiao · 2026-09-11
- OpenAI Agents API 接入 Cloudflare,4 分钟部署带 D1 日志的智能体 — craigsdennis · 2026-09-11
- 单张 RTX 3090 训 8 天:GPT-2 改造 MoE 从零训练成功 — rasbt · 2026-09-11
- B3IQ 两周卖出八位数 GPU,称 AI 基建是千亿美元机会 — templecrash · 2026-09-11
- 装个免费软件花掉 100 美元 API 费,agent 成本吐槽引共鸣 — MartinGTobias · 2026-09-11