Helion 驱动 vLLM 线性层,Hopper 上内核提速 1.11-1.18 倍
lmoroney · x · 2026-10-03
Red Hat、Meta 与 vLLM 团队在 PyTorch 博客发布新方案,用 Helion 为 vLLM 在 NVIDIA Hopper 上提供线性层后端:
- 一份 Helion GEMM 实现同时覆盖 Standard、Split-K、Swap-AB 三种变体,AOT 自动调优器为每种形状挑选最优配置
- 采用混合调度:小 token 数(≤32)走 Helion,更大批量回退到默认 CUTLASS 或 DeepGEMM
- 结果:相对默认内核库,几何平均内核加速约 1.11x–1.18x,部分工作负载端到端吞吐提升超过 10%
- 代码与自动调优工具已在其 vLLM fork 中提供,并已开 RFC 讨论上游合入
作者指出这也是很好的 ML 系统教学案例:在高层次表达算法一次,把形状相关的工作交给自动调优,并让热路径保持在 CUDA Graphs 下以保住调优收益。
所属事件:PyTorch Helion 内核接入 vLLM 推理吞吐显著提升(2 条相关)→
「Infra」频道最新
- 单张 L40S 批量渲染多路画面,voxlap 移植 CUDA 实时流式输出 — idanbeck · 2026-10-03
- 招股书披露:Anthropic 十年将投超 5180 亿美元建 AI 基础设施 — Beth_Kindig · 2026-10-03
- LibLayaX 开源:本地每秒 670 次决策的 Laya 模型多语言库 — felipedaragon · 2026-10-03
- 模型频繁更新杀死项目:自训路由器达不到新版 GLM 水平 — gaviniboom · 2026-10-03
- INT21 两工程师指挥 AI 两周造 20 个推理引擎,比 SGLang 快 2.4 倍 — bingxu_ · 2026-10-03
- Traversal 提出「自动驾驶生产」五级框架,直指编码 Agent 调试难题 — AI Engineer · 2026-10-03