180B 模型塞进单台 DGX Spark:2.39-bit 量化仅损失 4.5%

TheZachMueller · x · 2026-10-02

开发者 DJLougen 发布了 Qwen3.8-Flash-Next 的超低比特量化版本(Mooney),已上架 Hugging Face。

这意味着一个 1800 亿参数的 MoE 模型可以在单台 DGX Spark 上运行。作者感谢 Lambda 与 HF 的 Zach Mueller 提供算力支持。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →