WaiT 模型:引入小波感知流匹配,刷新像素空间 FID 记录
chaumian · x · 2026-08-04
论文《WaiT for the Signal》提出了一种名为 WaiT 的频率感知流匹配架构,旨在解决高分辨率图像生成中全局一致性与局部细节难以兼顾的问题。
核心创新:
- 小波分解:通过无损小波变换将生成过程分解为粗粒度和细粒度频带。
- 延迟高频生成:高频细节(纹理等)在初期保持纯噪声状态,直到粗略的全局结构生成完毕后,再加入流匹配过程进行联合优化。
评测表现:
- 引入了更严格的原生分辨率三轴评估协议,弥补标准 FID 因下采样丢失细节的缺陷。
- 在 ImageNet 512x512 上实现了 1.43 的像素空间 FID,并在所有轴向上达到帕累托最优,将采样计算量大幅减少 50%。
- 其 20 亿参数的最大模型在 ImageNet 512 上创下了 1.3 的像素空间 SOTA 记录。该架构还能无缝扩展至视频生成,在 Kinetics-600 上达到 0.84 的 SOTA FVD。
「多模态」频道最新
- ComfyUI 放出 MiniMax H3 原生文生视频工作流示例 — Replikante · 2026-08-04
- 一个 ComfyUI 工作流把 Wan 2.2 图生视频延到约 45 秒 — embryo10 · 2026-08-04
- H3 演示里一个细节:权重会随对话变化 — Oatilis · 2026-08-04
- Reddit 在比 Qwen3.5-VL、InternVL 和 Gemma 4 的图像描述能力 — TekeshiX · 2026-08-04
- AI 生成的“古中国”视频以视觉风格吸睛 — xiaosun86 · 2026-08-04
- ComfyUI 里先加模糊节点会让 Qwen Image Edit 报错 — UnorthodoxyMedia · 2026-08-04