176.9B MoE squeezed to ~1.89 effective bpw: GSQ-RCO GGUFs run Coder build in 29.6GB

Loginhe · reddit · 2026-09-29

ISTA DASLab released GSQ-RCO quantized GGUFs of Qwen3.8-Flash-Next (176.9B sparse MoE, 512 routed experts per layer across 48 layers, 354GB at BF16) plus a 50% expert-pruned Coder build.

Original post →

More from Models

Models channel →