FreeToken framework claims major MoE inference speedups

wavefnx · x · 2026-08-18

FreeToken is a new framework claiming to serve MoE models significantly faster than llama.cpp, ktransformers, or Ollama. The paper was released yesterday; while binaries are available, the code has been taken down. The framework reportedly uses 'double buffers' for checkpointing, but performance verification awaits reverse engineering or code re-release.

Related event: FreeToken Claims Major MoE Inference Speedup(2 posts)→

Original post →

More from Infra

Infra channel →