SGLang 适配 NVIDIA Vera Rubin:Kimi K3 推理最高提速 20%
ying11231 · x · 2026-10-10
LMSYS 团队拿到两台 NVIDIA Vera Rubin 节点(8 GPU)的早期访问权限,将 SGLang(推理)和 Miles(RL 训练)移植到下一代平台,并针对 Kimi K3 NVFP4(2.8T 参数、1M 上下文、69 层 KDA + 24 层 MLA、896 专家 LatentMoE)做了内核优化:
- batch 1 / 128K 上下文下 FP8 MLA 最高快 20%
- KDA 验证快 20%,输出 bitwise 一致
- MoE 尾融合带来 5.9% 端到端加速,每步 decode 减少 276 次 kernel 启动
- Miles 在 Rubin 上开箱即用地跑端到端 RL,包括在 Vera CPU 上以 64 个并发 sandbox 跑 agentic RL
Vera Rubin 相比 Hopper/Blackwell 的关键变化:每 CTA 共享内存 327 KiB(原 227 KiB)、212 个 SM、NVLink 6。Cognition 已部署 Vera Rubin NVL72 + 自研 SGLang 栈,总 token 吞吐较 GB200 NVL72 最高提升 4.8 倍。
「Infra」频道最新
- SGLang 适配 NVIDIA Vera Rubin,Kimi K3 推理提速最高 20% — charles_irl · 2026-10-10
- 论文提出嵌套并行冯诺依曼架构:百万处理器仍是单一计算机 — bronzeagepapi · 2026-10-10
- 「CUDA 核心」自 Kepler 起就是营销数字?SM 数量才是真实性能指标 — blelbach · 2026-10-10
- 高速立交环岛闲置地或成数据中心选址新思路 — gregmushen · 2026-10-10
- 规模越大越便宜:数据中心能耗背后的工业学习曲线逻辑 — Afinetheorem · 2026-10-10
- 多智能体系统 105 小时自动调优,Qwen3.5 推理提速 175 倍超 SGLang — bariskasikci · 2026-10-10