极限压缩测试:DeepSeek-V4-Flash 暴力量化至 54GB 仍可跑
giveen · reddit · 2026-08-05
为了测试模型量化的极限,开发者将原本 95GB 的 DeepSeek-V4-Flash bf16 模型,通过混合量化技术(IQ2XXS 变体配合 w2Q2K-AProjQ8-OutQ8)暴力压缩到了 54GB。
性能表现
- 在消费级硬件上,该 54GB 的量化版本(GGUF 格式)能够以约 20.5 tokens/s 的速度稳定生成文本。
- 测试数据显示,Prompt 评估速度为 32.24 tokens/s,生成速度为 20.54 tokens/s。
评价
作者坦言,虽然这种极端的 2-bit 量化对于复杂的逻辑推理是否实用还有待商榷,但它成功削减了超过 40GB 的内存占用,且依然保持了连贯的文本生成能力。
「Infra」频道最新
- 升级 CUDA 至 13.3 解决 DeepSeek V4 循环输出问题 — Easy_Werewolf7903 · 2026-08-05
- NVIDIA 实战:在 DGX Station 本地部署 550B 参数 Nemotron 3 Ultra — NVIDIA Developer · 2026-08-05
- Together AI 月处理 Token 数从 300 亿飙升至 400 万亿 — togethercompute · 2026-08-05
- API 密钥过期致 Agent 失控,一夜烧光 300 美元算力 — voooooogel · 2026-08-05
- 用 GLM 智能体 20 分钟打造像素屏 GPU 集群监控面板 — Porespellar · 2026-08-05
- DeepSeek-V4-Flash 成功在 4 张 4090 上跑通 256k 上下文 — dangerous_inference · 2026-08-05