QwenImage 2.1 引入 KV Cache,实测图像生成提速 2.55 倍
RisingSayak · x · 2026-09-21
作者发布技术线程,解析 QwenImage 2.1(7B DiT)如何引入 KV Caching 加速去噪采样:
- 核心思路:将固定上下文(文本与参考图像)与每个去噪步骤都在变化的目标图像位置分离,固定部分只算一次并缓存 K/V,后续步骤大幅降本。
- 序列构建:Qwen3-VL 文本位置与条件图像 latent 交错、目标图像 latent 排在最后,"前缀"即目标之前的全部联合序列位置。prefill 时每层只保存前缀 K/V。
- 与 MMDiT/FLUX2 的区别:经典 MMDiT 联合注意力是双向的(FLUX2 只缓存参考图 token);QwenImage 2.1 的信息流变为方向性,因此整个前缀(文本+参考图)都可复用。decode 阶段每层计算目标 Q/K/V,并将缓存的前缀 K/V 拼接进注意力。
- 实测数据:在预热 A100、2 张 1024×1024 参考图、40 步设置下,DiT 时间从 50.57s 降至 19.86s(2.55× 加速),代价是显存从 32.3G 升至 36.0G,作者称显存还有优化空间。
「多模态」频道最新
- 开源 3DGS 工具 LichtFeld 转向端到端:单目行走 30FPS 实时稠密重建 — janusch_patas · 2026-09-21
- 播放破5000万,作者公开 AI 短片 Punch Monkey 全套生成工作流 — HashemGhaili · 2026-09-21
- 蒸汽迷雾风故障艺术提示词模板,一键生成数字衰败感图像 — LudovicCreator · 2026-09-21
- 全 AI 生成音乐 MV:Seedance 2.5 让昂贵 MV 制作成为过去 — aitrendz_xyz · 2026-09-21
- Qwen-Image 2.1 LoRA 训练翻车:肢体崩坏成通病,社区摸索补救方案 — ResidentFrame4195 · 2026-09-21
- 肝一夜做 Dario 大战 Altman 视频,Seedance 2.5 换皮老动画引热议 — jjvincent · 2026-09-21