SGLang 适配 NVIDIA Vera Rubin,Kimi K3 推理提速最高 20%

charles_irl · x · 2026-10-10

SGL 项目宣布与 NVIDIA 合作,将 SGLang 移植到尚未发布的 Vera Rubin 硬件上,加速 Kimi K3 推理。在早期 Rubin 硬件上优化了 attention、MoE 与投机验证 kernel:

SGLang 还为 Miles 的端到端 RL 训练提供 rollout 支持,包括在 Vera CPU 上运行 64 个并发沙箱的 agentic RL。完整工程细节见原帖链接。kwafam7 转发时评论「We are not a car」。

所属事件:SGLang 适配英伟达 Vera Rubin,Kimi K3 推理最高提速 20%(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →