PyTorch Helion 内核接入 vLLM 推理吞吐显著提升

PyTorch 在官方博客中宣布,Red Hat、Meta 与 vLLM 团队合作,将内核 DSL Helion 接入 vLLM 的线性层后端,用于 NVIDIA Hopper 架构上的生产推理。结果显示,单一 Helion GEMM 实现即可覆盖多种场景,部分负载吞吐提升超过 10%,在 Hopper 上内核提速达 1.11 至 1.18 倍,展示了 Helion 在生产环境中的实际价值。

2026-10-03 ~ 2026-10-03 · 2 条相关