深度优化 Automatic1111 苹果 M 芯片:图生图耗时砍掉 40%

Time-Conversation528 · reddit · 2026-08-12

作者分享了在不迁移至 ComfyUI 的前提下,如何将 Automatic1111 在 Apple Silicon(M1 16GB)上的 SD1.x 渲染时间缩短约 40%(512x512 图片约需 8.5 秒)。

核心优化手段:

工程经验:

作者强调了一条核心原则:“微基准测试提名,完整生成选举”。许多在局部看似提升明显的优化(如打包 QKV、K/V 缓存或将整个 ResBlock 移入 MPSGraph),在实际端到端生成中反而更慢,最终都被删除。目前剩余 87% 的时间消耗在采样和 UNet 上,下一步计划尝试通过原生 Metal/ggml 重放 UNet 工作负载,除非能带来 20% 以上的提升,否则不值得增加复杂性。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →