180B 模型塞进单台 DGX Spark:2.39-bit 量化仅损失 4.5%
TheZachMueller · x · 2026-10-02
开发者 DJLougen 发布了 Qwen3.8-Flash-Next 的超低比特量化版本(Mooney),已上架 Hugging Face。
- 专家层 2.125-bit,全模型平均 2.39 bits/weight
- 下载体积 92 GB,内存占用约 39 GiB
- 保留 BF16 原始成绩的 95.5%
这意味着一个 1800 亿参数的 MoE 模型可以在单台 DGX Spark 上运行。作者感谢 Lambda 与 HF 的 Zach Mueller 提供算力支持。
「Infra」频道最新
- 安全研究者重提 DataScalar:90 年代被埋没的近数据计算架构 — lauriewired · 2026-10-02
- Frontier 航空宣布 2027 年初为机队装上 Starlink 高速 WiFi — elonmusk · 2026-10-02
- Amazon 封禁 Meta Muse 引思考:云上 Agent 需要住宅 IP 吗 — SignificantFail3632 · 2026-10-02
- Open Anonymity 上线 OA-chat,联手以太坊基金会推 zkAPI 隐私协议 — kenziyuliu · 2026-10-02
- Brendan Gregg 性能分析方法论指南:从 USE 到 Off-CPU 系统排查套路 — DanielLockyer · 2026-10-02
- Musk:AI5 砍内存至 72GB,为 Optimus 量产让路,带宽不减性能无损 — PTrubey · 2026-10-02