176.9B 模型压到 1.89 有效 bpw,29.6GB 单卡跑 Coder 版

Loginhe · reddit · 2026-09-29

ISTA DASLab 发布 Qwen3.8-Flash-Next 的 GSQ+RCO 量化 GGUF,以及一个砍掉一半专家的 Coder 版本。原模型为稀疏 MoE:48 层、每层 512 个路由专家,176.9B 参数,BF16 下 354GB。

量化版本

Coder 版(专家剪枝)

论文与代码均已开源,仓库含完整逐张量 RCO 分配方案。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →