深度优化 Automatic1111 苹果 M 芯片:图生图耗时砍掉 40%
Time-Conversation528 · reddit · 2026-08-12
作者分享了在不迁移至 ComfyUI 的前提下,如何将 Automatic1111 在 Apple Silicon(M1 16GB)上的 SD1.x 渲染时间缩短约 40%(512x512 图片约需 8.5 秒)。
核心优化手段:
- Metal Flash Attention:针对特定 SD 注意力形状选择性加速。
- 减少 CPU/GPU 同步:停止在每次注意力调用后提交 Metal 命令缓冲区,使其在 PyTorch MPS 流内运行。
- 统一内存感知注意力:大注意力操作根据可用内存动态回退到分块的次二次注意力。
- 算子融合:在 Metal 中融合 GroupNorm + SiLU 与 GEGLU。
- FP16 VAE:在 M1 上开启 FP16 VAE,使解码加传输时间从 1.5 秒降至不到 1 秒。
工程经验:
作者强调了一条核心原则:“微基准测试提名,完整生成选举”。许多在局部看似提升明显的优化(如打包 QKV、K/V 缓存或将整个 ResBlock 移入 MPSGraph),在实际端到端生成中反而更慢,最终都被删除。目前剩余 87% 的时间消耗在采样和 UNet 上,下一步计划尝试通过原生 Metal/ggml 重放 UNet 工作负载,除非能带来 20% 以上的提升,否则不值得增加复杂性。
「Infra」频道最新
- AI算力热潮推高概念股,TL20指数年内涨幅达59% — TiernanRayTech · 2026-08-12
- Vercel 实战:每分钟 6000 次部署下如何平滑迁移核心数据库 — evilrabbit_ · 2026-08-12
- 分析师:服务器 CPU 市场即将迎来前所未有的 S 型曲线跃升 — BenBajarin · 2026-08-12
- RTX 4090 换 DGX Spark 跑 ComfyUI 反而卡爆? — jungseungoh97 · 2026-08-12
- 分析师预计2030年服务器CPU市场达2200亿美元 — BenBajarin · 2026-08-12
- HuggingFace 模型日均下载量骤降约 30%,疑因平台过滤机制调整 — natolambert · 2026-08-12