B200 benchmark: NVFP4 decodes up to ~8% faster than MXFP4 in low-batch LLM inference

StasBekman · x · 2026-10-11

Cezar Cocu published a production-workload benchmark comparing NVFP4 and MXFP4, going beyond format-level comparisons.

Original post →

More from Infra

Infra channel →