SGLang 适配 NVIDIA Vera Rubin,Kimi K3 推理提速最高 20%
charles_irl · x · 2026-10-10
SGL 项目宣布与 NVIDIA 合作,将 SGLang 移植到尚未发布的 Vera Rubin 硬件上,加速 Kimi K3 推理。在早期 Rubin 硬件上优化了 attention、MoE 与投机验证 kernel:
- batch 1 / 128K 上下文下 FP8 MLA 提速最高 20%
- KDA 验证提速 20%,输出 bitwise 一致
- MoE tail fusion 每步解码减少 276 次 kernel launch,端到端推理提速 5.9%
SGLang 还为 Miles 的端到端 RL 训练提供 rollout 支持,包括在 Vera CPU 上运行 64 个并发沙箱的 agentic RL。完整工程细节见原帖链接。kwafam7 转发时评论「We are not a car」。
所属事件:SGLang 适配英伟达 Vera Rubin,Kimi K3 推理最高提速 20%(2 条相关)→
「Infra」频道最新
- Alchemy 搭配 Cloudflare 部署迭代飞快,可直接上云免开本地 dev server — samgoodwin89 · 2026-10-10
- FT 揭 OpenAI 与 Anthropic 收入口径差异:同业务 ARR 可差数十亿美元 — rohanpaul_ai · 2026-10-10
- AI 基建工程师玩梗:立法禁止前沿模型一切动态性 — charles_irl · 2026-10-10
- Basalt 推理引擎:5090 上跑出 665 tok/s,达 Strata 2.6 倍 — jesdga95 · 2026-10-10
- Supabase 网站访问量连续 12 个月超 Vercel,AI 开发层一年翻倍 — FinanceYF5 · 2026-10-10
- Google AI Pro 订阅捆绑 Colab 权益:80GB A100 可全参微调 Gemma 31B — algo_diver · 2026-10-10