极限压缩测试:DeepSeek-V4-Flash 暴力量化至 54GB 仍可跑

giveen · reddit · 2026-08-05

为了测试模型量化的极限,开发者将原本 95GB 的 DeepSeek-V4-Flash bf16 模型,通过混合量化技术(IQ2XXS 变体配合 w2Q2K-AProjQ8-OutQ8)暴力压缩到了 54GB。

性能表现

评价

作者坦言,虽然这种极端的 2-bit 量化对于复杂的逻辑推理是否实用还有待商榷,但它成功削减了超过 40GB 的内存占用,且依然保持了连贯的文本生成能力。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →