NVIDIA 借 GPU 间 RDMA 将 DeepSeek 启动缩至 2 分钟

NVIDIA 发布技术博客称,其 Dynamo 框架中的 ModelExpress(MX)技术成功将 DeepSeek-V4 Pro 模型的启动时间从原本的 8 分钟大幅压缩至 2 分钟以内。这一显著提速的核心机制在于改变了模型权重的搬运路径,通过采用 GPU-to-GPU RDMA 的最快数据传输路径,直接将权重送入显存,从而极大地优化了大型模型的部署与启动效率。

2026-07-25 ~ 2026-07-25 · 4 条相关

另有 3 条近重复转述:NVIDIAAI · RisingSayak · pmttyji