176.9B 模型压到 1.89 有效 bpw,29.6GB 单卡跑 Coder 版
Loginhe · reddit · 2026-09-29
ISTA DASLab 发布 Qwen3.8-Flash-Next 的 GSQ+RCO 量化 GGUF,以及一个砍掉一半专家的 Coder 版本。原模型为稀疏 MoE:48 层、每层 512 个路由专家,176.9B 参数,BF16 下 354GB。
量化版本
- 4 个 GGUF:2.40–3.50 bpw(66.4–83.6GB),另附 BF16 视觉投影器。
- GSQ(Gumbel-Softmax 量化):训练后标量量化,联合学习网格分配与组缩放,低比特下逼近向量量化效果且兼容标准 GGUF。
- RCO(黎曼约束优化):用梯度下降在任务损失上强制满足精确预算,既为每个张量分配量化类型,也在 Coder 版中逐层选专家。
- 成绩:3.50 bpw 的 IQ3S(83.6GB)全面追平 BF16——AIME25 100.00,GPQA-Diamond 92.93(BF16 为 91.92),任务平均 93.26 vs 93.12;2.40 bpw 的 Q20 平均 78.00,反超 BF16 的 76.94。
Coder 版(专家剪枝)
- 每层保留 256/512 专家(RCO 按 KL 散度挑选),保留权重仍为 3.5 bpw,等效约 1.89 bpw(非单权重实际位宽)。
- n-gram 分片可放磁盘,常驻工作集仅 29.6GB,单张 32GB 卡可跑。
- SWE-bench Verified 75.60(保留 91.3%),LiveCodeBench v6 86.28(保留 98.7%)。
论文与代码均已开源,仓库含完整逐张量 RCO 分配方案。
「模型」频道最新
- Sonnet 5.5 一条 prompt 一键复刻月入 10 万美元的应用 — PrajwalTomar_ · 2026-09-29
- Bindu Reddy 爆料:OpenAI 明天可能不会发布新模型 — bindureddy · 2026-09-29
- 博主研究 Opus 5.5 模型行为:用它写出完美的 HyperFrames 视频 — toolstelegraph · 2026-09-29
- EMNLP 论文 ToolLoop:分三阶段反向合成工具调用训练数据 — jiqizhixin · 2026-09-29
- CrofAI 倒闭内幕:Kimi K3 请求被偷换成更便宜的小模型 — richdotca · 2026-09-29
- 爆料圈降温:ChrisGPT 称本周不会有 Kimi 新模型发布 — ChrisGPT · 2026-09-29