NVIDIA EPD 分离架构:图像首 Token 最快提速 5 倍

dl_weekly · x · 2026-09-22

NVIDIA 发布技术博客,介绍其在 Dynamo 推理框架中实现的 encode-prefill-decode(EPD)分离架构:把视觉编码从 LLM 的 prefill/decode 阶段拆出来,加速多模态模型服务。

关键数据:

三种编码器部署拓扑:

收益取决于输入媒体负载、输出长度、模型大小与精度及流量配比;当 decode 占主导或大稠密模型削弱视觉编码算力占比时,收益会缩水。博客还给出后续优化方向:并行媒体解码、embedding 缓存复用、多模态 KV 路由,并提供 ai-dynamo/dynamo 的复现指南。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →