Z-Image GGUF 量化实测:Q4_K+Qwen3-4B 塞进 8GB 显存
Kordeyl · reddit · 2026-10-07
作者花数周将 Z-Image Turbo / CyberRealistic v9 量化为 GGUF,让 8GB 显存显卡无需把文本编码器换到 CPU 即可运行,并打包了完整资源(扩散模型、Qwen3-4B 编码器、VAE 一个仓库搞定)。
关键内容
- 扩散模型(Lumina2 架构)提供 Q3K 到 Q80 各档,8GB 显存首选 Q4K(5.15GB)+ 编码器 Q4KM(2.50GB)
- 踩坑:Z-Image 的 S/M/L 混合量化产物与基础 K 字节级相同(llama-quantize 写出同样的文件),唯独 Q4 的 Q4KS 与 Q4K 真正不同
- xpadtoken 报错:ggml 量化时会丢弃形状的前导 1,cappadtoken 被写成 [3840] 而非 [1,3840],导致 ComfyUI 加载报 size mismatch。解法:改用 Z-Image Power Nodes 加载器,或用脚本修补张量形状(ComfyUI-GGUF PR #392 已修复)
- 采样参数:steps 8(Turbo 蒸馏,超过 10 步反而变差)、cfg 1.0、euler、1024×1024
- 在 GTX 1070(8GB)实测:显存占用 72%,还余约 1GB;示例图原生 1024×1024 无后期,每张 PNG 内嵌完整工作流可直接拖入 ComfyUI
「Infra」频道最新
- Datology 开源 Zephon:确定性流式 dataloader 解决 GPU 数量不一致难题 — josh_wills · 2026-10-07
- 两张老 V100 本地跑 321B GLM-5.3-Flash:开源 Project Maya 实测 40 token/s — lxfater · 2026-10-07
- 数据中心耗水耗电被夸大?铝厂一年用电等于整个波士顿 — csuwildcat · 2026-10-07
- Omarchy Linux 官方推出浏览器远程桌面插件 — juntao · 2026-10-07
- Intel CEO 确认将继续与马斯克 Terafab 合作造芯 — elonmusk · 2026-10-07
- Symmetrix-XL 开源发布:单 GPU 跑千万原子级 MACE 分子模拟 — CatAstro_Piyush · 2026-10-07