PyTorch Helion 内核接入 vLLM:部分负载吞吐提升超 10%
PyTorch · x · 2026-10-03
PyTorch 发布博客,展示其内核 DSL Helion 在生产推理中的效果:团队将 Helion 接入 vLLM 的线性后端。
- 单一 Helion GEMM 实现可覆盖多种算法变体——标准 GEMM、Split-K、Swap-AB,并按张量形状自动选择最优变体与配置。
- 在 NVIDIA Hopper GPU 上,结合逐形状调优与混合分发,Helion 在评测的各模型上均优于 vLLM 默认的 CUTLASS 与 DeepGEMM 后端。
- 端到端收益稳定,部分负载吞吐提升超过 10%。
- 作者为 Red Hat 的 Sean Chen 与 PyTorch(Meta)的 Shangdi Yu。
「Infra」频道最新
- 苹果因 AI Agent 收紧 macOS「完全磁盘访问」权限,需用户明确授权 — brianmichel · 2026-10-03
- SK 海力士旗下 Solidigm 传考虑 1500 亿美元 IPO,规模近三倍于 Arm — Beth_Kindig · 2026-10-03
- ezyang 深度解析:用 Roofline 模型在 Hopper 上训练 DeepSeek-V3 — ezyang · 2026-10-03
- DeepInfra 提前 2 天通知涨价 33%,开发者痛陈换模型之难 — julianharris · 2026-10-03
- KOL 算账:SpaceX 若明年上线 5GW 算力,年收入可达约 2000 亿美元 — JOBhakdi · 2026-10-03
- GPT-6.1 Sol 请求爆满,官方称扩容后速度将达昨日近两倍 — NandaVegg · 2026-10-03