NVIDIA EPD 分离架构:图像首 Token 最快提速 5 倍
dl_weekly · x · 2026-09-22
NVIDIA 发布技术博客,介绍其在 Dynamo 推理框架中实现的 encode-prefill-decode(EPD)分离架构:把视觉编码从 LLM 的 prefill/decode 阶段拆出来,加速多模态模型服务。
关键数据:
- 图像密集、输出较短的请求下,首 Token 时间(TTFT)最快提升 5 倍,端到端延迟最高提升 7 倍
- 混合文本与多模态流量中,消除队头阻塞使文本请求平均 TTFT 降低 42.2%,图像请求降低 30.8%
- 用 NVFP4 量化 LLM 权重、视觉编码器保持 BF16 时,colocated EPD 的 goodput 从 1.78x 提升到 2.64x
三种编码器部署拓扑:
- 聚合式服务(传统方式)
- 编码器与 prefill/decode worker 同卡共置(colocated)
- 编码器放在独立低价 GPU 层,通过 NIXL 传输库连接(完全分离)
收益取决于输入媒体负载、输出长度、模型大小与精度及流量配比;当 decode 占主导或大稠密模型削弱视觉编码算力占比时,收益会缩水。博客还给出后续优化方向:并行媒体解码、embedding 缓存复用、多模态 KV 路由,并提供 ai-dynamo/dynamo 的复现指南。
「Infra」频道最新
- peano_ai 在 1000+ TPU 上对 310B 模型跑通全参数 RL 训练 — simonguozirui · 2026-09-22
- 应对 AI 爬虫流量:Turnstile 之外的 Cloudflare AI Labyrinth 方案 — fforres · 2026-09-22
- cHHillee:软件护城河难敌 RSI,ML 基建价值在需求聚合 — PatrickToulme · 2026-09-22
- 树莓派固件锁定原始内存容量,禁止用户换更大 RAM — ngxson · 2026-09-22
- fal 推出 H3 Max:3 秒生成 5 秒前沿级视频,全栈优化揭秘 — gorkem · 2026-09-22
- 16GB Mac 本地跑 MiniMax H3 生视频:8-10 秒片段约 15-20 分钟 — coberholzer · 2026-09-22