Qwen3.8-Flash-Next 量化新方案:体积砍到约 1/5,跑分几乎无损
BullfrogScary8947 · reddit · 2026-09-16
ISTA-DASLab 发布 Qwen3.8-Flash-Next 的 GSQ-RCO GGUF 量化版本,把约 80-95GB 的模型压到 68-76GB,并保持接近基线的质量。要点:
- IQ3XXS 是最强档位:AIME25 与基线完全持平(100.00),GPQA-Diamond 差 0.51 分,LiveCodeBench v6 差 1.14 分,体积约为 BF16 的五分之一。
- Q20 主打速度:避开依赖大查找表的量化格式,较 IQ2XS 实现 3.4 倍 prompt 吞吐、1.9 倍更低端到端延迟,编码任务 prompt 吞吐提升 6.2 倍,decode 速率不随内容波动;代价是任务均分 89.07 对 89.16,比 IQ3XXS 低 3.5 分。
模型已在 Hugging Face 上线,适合本地部署时按吞吐/质量需求选档。
「Infra」频道最新
- 华为发布全球首个 3D 数据中心:四层垂直堆叠,交付周期砍半 — teortaxesTex · 2026-09-16
- 苏格兰新规:超 50MW 数据中心须强制提交环评 — nordicinst · 2026-09-16
- 微软押注本地 AI:从 800 美元 Copilot+ PC 到万亿参数桌面超算 — ryanshrout · 2026-09-16
- PlanetScale Traffic Control 新玩法:按应用名分配数据库资源 — DanielLockyer · 2026-09-16
- 欧洲 AI 创业者算力紧缺,VC 送 GPU 将成标配增值服务 — nellimorgulchik · 2026-09-16
- 128GB 小机跑 124B 模型:社区实测量化、MTP 与内核调优全记录 — alifcoder · 2026-09-16