ROCm上让ComfyUI的INT8更快
Itchy_Push_3077 · reddit · 2026-07-19
这是一篇很具体的 ComfyUI / AMD ROCm 性能优化分享,目标是让 Krea2 Turbo 的 INT8 ConvRot 在 AMD 卡上跑得更快。
作者先对比了三种路径:
- FP8:稳定,热启动约 12.74s
- INT8 ConvRot 安全回退:稳定但很慢,约 65–80s
- 全局 Triton:尝试快路径,但在 ROCm 上会崩溃
随后作者没有开启全局 Triton,而是只把 ConvRot 的 int8linear 路径单独切到 Triton 实现,其他部分仍走稳定路径。这样既避免了全局启用带来的崩溃,又保留了关键算子的加速。
结果是:
- 热启动从 FP8 的 12.74s 提升到 10.49–10.54s
- 相比原先的 INT8 回退路径,速度提升约 6–7.6 倍
这类帖子对 AMD/ROCm 本地部署用户很有参考价值。
「Infra」频道最新
- 推理服务关键指标盘点:流式速度 TPOT 与可用性如何影响体验 — abhijithneil · 2026-09-11
- PlanetScale 推出分片 Postgres,768 台服务器组成 1PB 单库 — dhruv2038 · 2026-09-11
- 7900 XTX 24GB 能否跑 Qwen,Reddit 征集 ROCm 实测数据 — thenomadexplorerlife · 2026-09-11
- 实测戳破 RTK 省钱神话:token 省了,账单分文未降 — Bartaseth · 2026-09-11
- SF Compute 创始人:现在买算力是「绝对糟糕的体验」 — IgorCarron · 2026-09-11
- 开源 SmolVM:2026 年 Agent 不止用浏览器,而是拥有整台电脑 — aniketmaurya · 2026-09-11