Helion 驱动 vLLM 线性层,Hopper 上内核提速 1.11-1.18 倍

lmoroney · x · 2026-10-03

Red Hat、Meta 与 vLLM 团队在 PyTorch 博客发布新方案,用 Helion 为 vLLM 在 NVIDIA Hopper 上提供线性层后端:

作者指出这也是很好的 ML 系统教学案例:在高层次表达算法一次,把形状相关的工作交给自动调优,并让热路径保持在 CUDA Graphs 下以保住调优收益。

所属事件:PyTorch Helion 内核接入 vLLM 推理吞吐显著提升(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →