FreeToken: Run 284B frontier models on consumer GPUs at interactive speeds

solyarisoftware · x · 2026-08-22

Researchers from UC Berkeley and MIT released FreeToken, an open-source MoE inference engine designed to run frontier-scale models on consumer hardware. Benchmarks show 39 tok/s for Qwen3.6-35B on an RTX 4060 and 25 tok/s for DeepSeek-V4-Flash 284B on an RTX 5090, claiming significant speedups over llama.cpp and Ollama.

Related event: UC Berkeley and MIT Open-Source FreeToken to Run Huge MoE Models on Consumer GPUs(8 posts)→

Original post →

More from Infra

Infra channel →