GLM 5.3 Flash spotted hitting 227 tok/s with 4 concurrent streams on DGX Spark

natesiggard · x · 2026-10-08

MiaAIlab demoed GLM 5.3 Flash running locally on an NVIDIA DGX Spark, reaching roughly 227 tokens/s across 4 concurrent mixed streams — a speed the poster calls "unreal." The version number suggests an unreleased GLM 5.3 Flash variant; details remain unconfirmed.

Original post →

More from Infra

Infra channel →