vLLM 实现 1T 参数模型分片传输,耗时仅 7.53 秒

TheZachMueller · x · 2026-08-26

vLLM 团队联合 SkyRL 实现了原生分片权重传输引擎,利用 Ray Direct Transfer (RDT) 和 NIXL,解决了大规模在线强化学习中模型权重同步的瓶颈。该实现支持密集模型、MoE 模型及量化模型。在 48 个 8xH100 节点上,Kimi K2 (1T 参数, BF16) 模型的分片权重传输仅需 7.53 秒。技术细节包括预处理与传输的重叠优化,以及展示 RDT 容错能力的演示。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →