Users Urge Neoclouds to Boost DeepSeek Speeds to 300-400 tok/s for Fast Models

brandon_galang · x · 2026-08-05

The author observes that despite previous competition driven by Kimi K3 to push token speeds, current inference speeds for new models on neoclouds remain underwhelming.

They urge providers to crank speeds up to 300-400 tok/s, creating an ideal "fast general model" for tasks that don't require maximum intelligence.

Original post →

More from Infra

Infra channel →