换一个 attention 节点,AMD iGPU 本地跑 MiniMax-H3 提速 2.5 倍
ShamanFlamingoFR · reddit · 2026-09-21
作者在三周前于 Ryzen AI Max+ 395(Radeon 8060S iGPU,128GB 统一内存)上本地运行 MiniMax-H3 视频生成后跟进:同样机器、同样图、同样模型,单次评测耗时从 45.7 秒降到 18.3 秒,端到端冷启动从 521 秒降到 206 秒,提速关键不是量化或 flag,而是一个 attention 节点终于有了对应内核。
核心做法
- 在 MiniMaxH3PDDAccApply 和 BasicGuider 之间插入 ModelAttentionBackend("comfy kitchen attention") 节点,其余设置不变;输出质量无损失(31.6 dB PSNR,音频相关性 0.995)。
- 该节点早在 8 月就进了 ComfyUI core,但当时内核未随附:comfy-kitchen 0.2.31 的 hip 后端没有 solattn;0.2.34(ComfyUI 0.36.0 锁定版本)加入 solattn/solattnchunked,并在 architectures. 中明确支持 gfx1150–1153,是官方支持路径而非偶然。
- 启动日志里 Found comfykitchen backend hip: 一行必须列出 solattn,否则节点会静默无效。
- 节点里的 pytorch attention 选项在 fp8 主干上会触发 HIP kernel launch 失败,gfx1151 上 SDPA 路径仍不可用。
其他进展
- 之前 Windows 上必须加 --disable-dynamic-vram 的崩溃(comfy-aimdo 0.4.15 的 vbar access violation)已在新版修复:ComfyUI 0.36.0 锁定 0.5.3,四次运行零崩溃,且冷启动更快(206s vs 266s),该 flag 未来将被移除。
- torch 显存碎片从 21.1 GB 降到 2.0 GB。
结论修正:时钟和权重不变的情况下,仅换 attention 实现就拿到 2.5 倍加速,说明此前的「带宽瓶颈」结论需要修正——瓶颈其实是 split attention 分块计算在 VRAM 里往返中间结果产生的额外流量,融合 INT8 内核消除了它。三段式 15 秒片段整链渲染从 31 分 40 秒缩至 13 分 11 秒(×2.4)。
「Fun」频道最新
- ICLR 2027 起的灵魂拷问:努力的到底是作者还是 Agent? — MuCai7 · 2026-09-21
- 全球首场人形机器人对战人类格斗赛开打,高 6 英尺机器人上场 — Admirable-Cell-2658 · 2026-09-21
- 网友吐槽 AGI、ASI、RSI 已被滥用成企业营销黑话 — menhguin · 2026-09-21
- 迷宫实测:纯随机数生成器 892 步通关,碾压原地打转的 AI — karminski3 · 2026-09-21
- 「我最爱的浪漫小说作家」Caroline Ellison 梗图 — verdakorz · 2026-09-21
- 安全研究员吐槽:s-risk 原来是航班被迫降西雅图 S 航站楼 — EigenGender · 2026-09-21