vLLM 实现 1T 参数模型分片传输,耗时仅 7.53 秒
TheZachMueller · x · 2026-08-26
vLLM 团队联合 SkyRL 实现了原生分片权重传输引擎,利用 Ray Direct Transfer (RDT) 和 NIXL,解决了大规模在线强化学习中模型权重同步的瓶颈。该实现支持密集模型、MoE 模型及量化模型。在 48 个 8xH100 节点上,Kimi K2 (1T 参数, BF16) 模型的分片权重传输仅需 7.53 秒。技术细节包括预处理与传输的重叠优化,以及展示 RDT 容错能力的演示。
「Infra」频道最新
- 曝 OpenAI 推自研芯片,推理能效超越英伟达 Blackwell — petrusenko_max · 2026-08-26
- 2026 AI 项目为何失败?转向基建、人才与 ROI — mikeflache · 2026-08-26
- API 新品定价低至 1 美元千元,内建搜索与抓取工具 — testingcatalog · 2026-08-26
- 苹果 M5 Ultra 联网带宽达 4.8TB/s,媲美数据中心 GPU — awnihannun · 2026-08-26
- Snowflake 揭示 Agent 隐形成本,优化方案降低 33%-45% — StasBekman · 2026-08-26
- M5 Ultra Studio 定价「破坏性」:本地模型托管性价比达 DGX Spark 的 2-3 倍 — SumitGup · 2026-08-26