Krea-2-Turbo推量化版,最低6GB显存可跑图
ali_byteshape · reddit · 2026-08-12
针对高显存成本痛点,开发者为图像生成模型 Krea-2-Turbo 发布了量化版本,提供适用于 ComfyUI 的 GGUF 格式和适用于 vLLM-Omni 的 Humming 格式。
- 显存需求:最低降至 6.14 GB(3.83 bpw),最高 14.31 GB(8.93 bpw)。
- 性能对比:在 RTX 5090 上生成 1024×1024 图像时,Humming 内核比 GGUF 快约 1.6 倍(单步约 0.41 秒 vs 0.67 秒),8步生图全程仅需约 4.0 秒。
- 画质评估:团队在 24 个固定提示词下对比了所有量化版本与基线模型的画质,并提供了在线滑块对比工具。
目前 Humming 路径仍处于实验阶段,仅支持 Linux + NVIDIA 环境。
「Infra」频道最新
- 80张RTX 5090跑满Kimi K3全量模型,Bittensor网络提供半价平替API — markjeffrey · 2026-08-13
- 美能源部拟将 20% 预算投入计算基础设施 — thoefler · 2026-08-13
- CoreWeave与W&B联合举办Fully Connected大会,聚焦生产级AI基础设施 — wandb · 2026-08-13
- vLLM 首日支持 Qwen3.8 2.4T 模型,提供开箱即用 4-bit 量化 — vllm_project · 2026-08-13
- Groq 获英伟达认证,正式成为云合作伙伴 — GroqInc · 2026-08-13
- 体积暴降 91%!Unsloth 实现 Qwen3.8 本地运行 — danielhanchen · 2026-08-13