Gemma 4 31B hits 3,431 tokens/s on NVIDIA Groq 3

GlennCameronjr · x · 2026-08-27

Benchmarks on NVIDIA's Groq 3 LPX accelerator show Gemma 4 31B achieving a median output of 3,400 tokens/s across 10k and 100k input sequences, setting a new speed record for the model at 100k context.

Related event: NVIDIA Groq 3 LPX Hits 3,400+ tok/s Decoding on Small Models(2 posts)→

Original post →

More from Infra

Infra channel →