PyTorch and AMD Optimize FP8 Training: Over 13% Throughput Gain

PyTorch · x · 2026-08-14

A recent PyTorch blog post details how AMD has upstreamed FP8 training optimizations into PyTorch/TorchTitan and PyTorch/TorchAO, enabling out-of-the-box FP8 training on AMD Instinct GPUs.

Key optimization results include:

These improvements were achieved by systematically fusing Triton quantization kernels, enabling grouped GEMM for ROCm, and building a Triton fusion pipeline.

Original post →

More from Infra

Infra channel →