Berkeley and MIT Open-Source FreeToken for Running Giant Models on Consumer GPUs
UC Berkeley and MIT researchers open-sourced FreeToken, a MoE inference engine that runs models up to 753B parameters on consumer hardware, including DeepSeek-V4 at 25 tok/s on a single RTX 5090, without large VRAM requirements.
2026-08-22 ~ 2026-08-22 · 3 related posts
- Berkeley open-sources FreeToken: run 35B models on a $1,000 RTX 4060 laptop — Yuchenj_UW · 2026-08-22
- Berkeley/MIT Open Source Inference Engine: RTX 5090 Runs 284B Models at 25 tok/s — gnukeith · 2026-08-22
- FreeToken: run 290B+ MoE models locally on a gaming PC, no big VRAM needed — gnukeith · 2026-08-22