PyTorch AOTI 后端加速 NVIDIA HSTU 推理 1.14x–1.28x

PyTorch · x · 2026-09-04

PyTorch 官方宣布,其 AOTI 后端在 NVIDIA 的 HSTU 推理测试中,相比 Python 后端实现了 1.14x–1.28x 的加速(使用 Triton Inference Server 部署)。在理想的全 GPU 缓存命中场景下,结合 KV 缓存,AOTI 后端可实现 2.20x–2.38x 的加速。结果来自 NVIDIA 的 recsys-examples 仓库,该仓库展示了使用 PyTorch 在 NVIDIA GPU 上训练和部署生成式推荐器的最佳实践,包括优化的 HSTU 和 Semantic ID 实现。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →