SGLang 适配 NVIDIA Vera Rubin:Kimi K3 推理最高提速 20%

ying11231 · x · 2026-10-10

LMSYS 团队拿到两台 NVIDIA Vera Rubin 节点(8 GPU)的早期访问权限,将 SGLang(推理)和 Miles(RL 训练)移植到下一代平台,并针对 Kimi K3 NVFP4(2.8T 参数、1M 上下文、69 层 KDA + 24 层 MLA、896 专家 LatentMoE)做了内核优化:

Vera Rubin 相比 Hopper/Blackwell 的关键变化:每 CTA 共享内存 327 KiB(原 227 KiB)、212 个 SM、NVLink 6。Cognition 已部署 Vera Rubin NVL72 + 自研 SGLang 栈,总 token 吞吐较 GB200 NVL72 最高提升 4.8 倍。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →