实测打脸:DGX Spark 上 bf16 反而比 int8 convrot 更快,H3 视频生成差 14 秒
dtdisapointingresult · reddit · 2026-09-29
一位 Reddit 用户在 DGX Spark 上实测 ComfyUI 的 int8 convrot 量化模型,结果颠覆预期:int8 并没有带来预期的 40-50% 提速,甚至更慢。
测试方法(用 ComfyUI 内置模板,先预热缓存、改 prompt 首字符破坏 prompt 缓存、只测第二次生成):
- Z-Image-Turbo:int8convrot(6.3GB)6.60s;bf16(13GB)7.63s;nvfp4(4.6GB)5.37s 最快
- H3 视频(5 秒视频):int8convrot(21GB)286.66s;bf16(40.2GB)反而只要 272.22s
作者重复了多次测试,结果一致。结论:量化并不总是更快,反量化开销可能抵消甚至倒挂收益,升级量化版本前最好先实测自己的硬件。作者使用 --use-ck-attention --disable-mmap --cache-classic 启动参数。
「Infra」频道最新
- SemiAnalysis 拆解 GLM-5.3:稀疏注意力为何没能省下 HBM 内存 — burny_tech · 2026-09-29
- 蒙特利尔 Exploit Summit 亮点:Bittensor 生态大版图一览 — markjeffrey · 2026-09-29
- Bain 测算:AI 到 2031 年需年入 6 万亿美元才能撑住算力建设 — sanjaykalra · 2026-09-29
- BAAI CoWA 注意力架构:全因果覆盖改为集体属性,训练延迟降 7.4 倍 — BAAI · 2026-09-29
- BAAI 推出 MALA 注意力:128K 上下文训练延迟降 2.2 倍 — BAAI · 2026-09-29
- Databricks 用 AI 智能体登顶 NVIDIA 内核榜单,总花费仅约 7 万美元 — Yuchenj_UW · 2026-09-29