Laptop engine streams a 35B model from SSD at 9.4 tok/s, beating GPT-OSS 20B

ImBadGuyInEveryStory · reddit · 2026-09-27

A poster's custom inference engine streams Ornith 1.5 35B (22GB) mostly from an SSD on a laptop with RTX 2050 4GB VRAM and 16GB RAM, hitting 9.4 tok/s — faster than GPT-OSS 20B's 6 tok/s in LM Studio. He asks whether pruned versions of top open MoE models (like Kimi K3) exist under 80GB at Q4 or above, ideally good for web dev, and how others have pruned older models like mimo v2.6.

Original post →

More from Infra

Infra channel →