新 GGUF 格式 Q8_CR 让 Krea 2 速度接近 INT8
molbal · reddit · 2026-07-27
核心更新
- Reddit 开发者发布了一种面向扩散模型的新 GGUF 格式 Q8CR:把预旋转的 INT8 权重和 FP32 按行 scale 结合起来,同时保留少数对精度敏感的张量为高精度。
- 目标主要是 Ampere / Turing 显卡,并尽量利用 ComfyUI 的原生 INT8 ConvRot 路径。
结果数据
- 作者以 Krea 2 做测试,称 Q8CR 在文件更小的同时,速度几乎追平 INT8 基线。
- 测试结果:
- INT8:11.95 GB,基线速度
- Q80:13.56 GB,约为基线的 60.2%
- Q8CR:12.84 GB,约为基线的 100.4%
为什么不用 safetensors
- 作者认为 GGUF 更适合低显存推理:权重可以保持量化状态留在系统内存里,再按层搬进 VRAM,降低峰值显存。
- 相比之下,完整 INT8 safetensors 往往还是会进入 FP16/BF16 的常规执行路径,带来更多内存/带宽压力。
可用性
- 帖子附了 Krea 2 Turbo Q8CR 的 GGUF 文件和 ComfyUI-GGUF 自定义节点。
- 作者接下来还会测试 Flux 2 Klein、Z-Image、Ideogram。
「Infra」频道最新
- Nvidia 签下 15 亿美元 Amkor 合作扩产美国封装产能 — Beth_Kindig · 2026-07-27
- PyTorch DDP 默认没吃到这个 NVIDIA GPU 优化 — gordic_aleksa · 2026-07-27
- 本地 AI 女友项目用 15GB 显存跑通整套语音链路 — max_paperclips · 2026-07-27
- OpenAI 传出将斥资 300 亿美元建 3.2GW 佐治亚数据中心 — Beth_Kindig · 2026-07-27
- ComfyUI 实测:两张 RTX 5080 还是跑不过一张 RTX 5090 — Geekdomo · 2026-07-27
- 开源剖析器可追踪语音 Agent 每次 STT、LLM、TTS 调用 — mahimairaja · 2026-07-27