PyTorch AOTI 后端加速 NVIDIA HSTU 推理 1.14x–1.28x
PyTorch · x · 2026-09-04
PyTorch 官方宣布,其 AOTI 后端在 NVIDIA 的 HSTU 推理测试中,相比 Python 后端实现了 1.14x–1.28x 的加速(使用 Triton Inference Server 部署)。在理想的全 GPU 缓存命中场景下,结合 KV 缓存,AOTI 后端可实现 2.20x–2.38x 的加速。结果来自 NVIDIA 的 recsys-examples 仓库,该仓库展示了使用 PyTorch 在 NVIDIA GPU 上训练和部署生成式推荐器的最佳实践,包括优化的 HSTU 和 Semantic ID 实现。
「Infra」频道最新
- 曝 Astra 在 Stargate Texas 用 10 万 GPU,或成首个 10 亿美元训练 — ai · 2026-09-04
- Spark-2.5-4B 跑上 250 美元 Jetson Orin Nano,128K 上下文 2048 针测试 99.8% 通过 — Puzzleheaded_Base302 · 2026-09-04
- 沙特 AI 公司 Humain 拟募 25 亿美元建 250 兆瓦数据中心 — dinabass · 2026-09-04
- 1800 美元笔记本靠高通 NPU 实时跑 3B 本地模型,非加速演示 — draginol · 2026-09-04
- WCH 双核 RISC-V MCU 售 $3.3:400MHz 主频+USB 3.2 不到 5 美元 — yacineMTB · 2026-09-04
- OpenAI 员工实锤:Anthropic 换 tokenizer 让 Opus 4.7 隐性涨价约 30% — stevenheidel · 2026-09-04