TensorSharp outperforms llama.cpp for GLM-5.2 on long prompts

AdhesivenessWeird770 · reddit · 2026-08-20

Benchmarking GLM-5.2-UD-IQ2XXS on 3x RTX PRO 6000 Blackwell shows TensorSharp surpasses llama.cpp by up to 50% on long contexts (2048+ tokens) by optimizing MoE routing with larger micro-batches, while llama.cpp retains an edge on short prompts due to lower fixed overhead.

Original post →

More from Infra

Infra channel →