YC Benchmarks LLMs for Its AI Partners: GLM-5.2 on Wafer Wins With 31% Lower Latency

ycombinator · x · 2026-09-17

A YC partner shared how YC built AI versions of its partners for an Office Hour Simulator, needing fast, useful answers for spoken conversation. In head-to-head benchmarks against GPT-4.1 mini on OpenAI and Gemma 4 31B on Cerebras, GLM-5.2 on a dedicated Wafer endpoint delivered 31% lower average LLM latency than OpenAI and 44% lower than Cerebras. Users talked 2.5 minutes longer per session on the Wafer setup — a rare real-world selection case where a lightweight model plus dedicated inference beat mainstream options.

Related event: YC Builds AI Partner with GLM-5.2, 31% Lower Latency than OpenAI(2 posts)→

Original post →

More from Infra

Infra channel →