Nunchaku Lite 在 Diffusers 中显存减半、图像生成快 30%
RisingSayak · x · 2026-07-24
Nunchaku Lite 让大图像模型更容易跑起来
- 这次更新是 SVDQuant 4-bit(W4A4)扩散推理,并且已经 原生接入 Diffusers。
- 作者称它能把 峰值显存最高降低 50%,同时让生成速度提升约 30%,且没有明显破坏图像质量。
- 配图里的例子显示,峰值显存从 31.1 GB 降到 16.0 GB,端到端耗时从 3.00s 缩到 1.68s。
- 实际意义是:原本需要更高显存的图像模型,现在能在更多 GPU 上实用化运行。
「Infra」频道最新
- 推理服务关键指标盘点:流式速度 TPOT 与可用性如何影响体验 — abhijithneil · 2026-09-11
- PlanetScale 推出分片 Postgres,768 台服务器组成 1PB 单库 — dhruv2038 · 2026-09-11
- 7900 XTX 24GB 能否跑 Qwen,Reddit 征集 ROCm 实测数据 — thenomadexplorerlife · 2026-09-11
- 实测戳破 RTK 省钱神话:token 省了,账单分文未降 — Bartaseth · 2026-09-11
- SF Compute 创始人:现在买算力是「绝对糟糕的体验」 — IgorCarron · 2026-09-11
- 开源 SmolVM:2026 年 Agent 不止用浏览器,而是拥有整台电脑 — aniketmaurya · 2026-09-11