开发者将 180B 模型塞进单台 DGX Spark

开发者 DJLougen 发布了 Qwen3.8-Flash 的超低比特量化版本 Mooney,已上架 Hugging Face。通过 2.39-bit 量化(专家层仅 2.125-bit),该版本将 180B 参数模型装入单台 DGX Spark,精度损失约 4.5%,即保留约 95% 的性能,且长上下文能力不衰减,为本地运行超大规模模型提供了可行方案。

2026-10-02 ~ 2026-10-02 · 2 条相关