开发者将 180B 模型塞进单台 DGX Spark
开发者 DJLougen 发布了 Qwen3.8-Flash 的超低比特量化版本 Mooney,已上架 Hugging Face。通过 2.39-bit 量化(专家层仅 2.125-bit),该版本将 180B 参数模型装入单台 DGX Spark,精度损失约 4.5%,即保留约 95% 的性能,且长上下文能力不衰减,为本地运行超大规模模型提供了可行方案。
2026-10-02 ~ 2026-10-02 · 2 条相关
- 180B 模型塞进单台 DGX Spark:2.39-bit 量化仅损失 4.5% — TheZachMueller · 2026-10-02
- 开发者发布 Qwen3.8-Flash 低比特量化:保留 95% 精度且长上下文不衰减 — Crampappydime · 2026-10-02