9070 XT 上 SageAttention 提速近 2 倍:作者手写 HIP kernel 并放出 wheel
Familiar_Worry332 · reddit · 2026-10-02
一位 ComfyUI 用户为 RX 9070/9070 XT 发布了可直接安装的 SageAttention 构建(Windows),常见场景(fp16、headdim 128)跑在他手写的 HIP fp8 attention kernel 上。相比现有 gfx12 移植(SageAttention PR #368),单次 attention 调用非因果提速 1.07–1.21×,因果场景提速 1.72–1.96×;在 ComfyUI + Krea2 实测中,采样每步比 PyTorch SDPA 快 5–14%,且随分辨率提升收益更大。
性能关键:每轮迭代处理 64 个 key(而非 16)、按转置计算 Q·Kᵀ 使 attention 权重不离开寄存器、对 Q/K/V 采用逐 token 而非逐 64-token block 的缩放。失败尝试大多记录在仓库的 JOURNEY.md 和 FINDINGS.md。
精度真相:与从 Krea2 和 Flux2-Klein 内部捕获的真实 Q/K/V 对比,在「平静」层上 #368 的 int8 Q·K 更精确;但在含极端 outlier key 的层(如 Krea2 首个 block),#368 误差可爆炸至约 200 倍,而逐 token 缩放没有这种坏情况。smoothk 默认开启且应保持开启。作者在 Krea2 上肉眼已无法区分与全精度 attention 的差异。
注意事项:仅支持 RX 9070/9070 XT (gfx1201),其他 GPU 自动回退到 #368 无收益;仅 Windows 实测;预编译 wheel 需要 Python 3.12 + PyTorch 2.13.0+rocm10.0.0。安装后照常加 --use-sage-attention 即可。
所属事件:开发者让 RX 9070 XT 跑通 SageAttention,提速近 2 倍(2 条相关)→
「Infra」频道最新
- Modal 发布 BYOC 2.0,云端编码 agent 敏感数据可留在自家账户内 — charles_irl · 2026-10-02
- GPT-6 Astra Ultrafast 上线:跑在 NVIDIA Blackwell 上,出 token 快 8 倍 — nvidia · 2026-10-02
- OpenAI 推出 GPT-6 Astra Ultrafast,Blackwell 上提速 8 倍 — NVIDIA Blog · 2026-10-02
- Ben Lorica:AI 数据问题已转移,从找原料变为加工可用 — bigdata · 2026-10-02
- 加州男子被捕:涉走私超3亿美元AI服务器至中国 — Polymarket · 2026-10-02
- 投资人吐槽:投了钱还得求 GPU 厂给被投公司明年配额 — mattturck · 2026-10-02