YC's AI Office Hours: Wafer hits 379ms vs Cerebras 674ms, 44% lower latency

ycombinator · x · 2026-09-27

For YC's AI Office Hours — AI versions of its partners giving startup advice at conversational speed — Wafer ran GLM-5.2 at an average 379ms versus 674ms for Gemma 4 31B on Cerebras, 44% lower latency with a much larger model. After testing lightweight Gemma and OpenAI models, YC moved to a dedicated Wafer endpoint; Wafer agents tuned serving for request rate, cache usage, and prompt/response lengths. Users spent 2.5 minutes longer talking to the AI partners on Wafer.

Original post →

More from Infra

Infra channel →