FP8 调优砍掉 42.9ms,SGLang 自改内核推理提速 126%
HankYeomans · x · 2026-09-23
作者分享在 RTX 6000 Pro 上做 LLM 推理优化的阶段性成果与心得。
- 关键收益来自 FP8 调优:代码中默认针对 H100 调好的配置并不适配其他卡,调掉 H100 默认项、针对 RTX 6000 Pro 优化 W8A8 FP8 GEMM 解码步骤后,单步时间从 70ms 基线中砍掉 42.9ms,是该实验中最大的一项提升(约 +126%)。
- 具体做法:fork 了 SGLang 的 kernel 并加入 RTX 6000 Pro 专属配置。发现 kernel 回退(fallback)路径只有约 80GB/s,调优后达到 750GB/s(该卡理论上限 1600GB/s)。
- 核心结论:在这类实验中,把毫秒级的每步延迟磨下来,往往能带来最大的整体收益。
「Infra」频道最新
- Google Colab 并入 Google AI 订阅,可享更快 GPU 与后台执行 — DynamicWebPaige · 2026-09-23
- NEAR AI 机密推理上线 Bittensor,GM 一个 API 接数十模型 — markjeffrey · 2026-09-23
- 推理提速不只靠模型:拆解 6 项 LLM 服务端关键优化技术 — techNmak · 2026-09-23
- SanDisk 股价大涨 7.56%,华尔街看好 AI 内存需求 — Polymarket · 2026-09-23
- SGLang v0.5.20 发布:Intel XPU 入列,解码最高提速 52% — hsu_byron · 2026-09-23
- 93% 新项目来自 AI,Netlify 为数百万 agent 站点自建 Git 存储 — jasonkneen · 2026-09-23