WaiT for the Signal 用频率感知 flow matching,把采样算力降了 50%
TimDarcet · x · 2026-08-04
论文 WaiT for the Signal 提出一种面向图像生成的 频率感知 flow matching 方法。
- 该方法用 无损小波 把生成过程拆成粗粒度和细粒度两个频段,让高频部分先保持噪声状态,等低频结构先成形后再一起细化。
- 作者认为传统 FID 会因为下采样过猛而掩盖细节,因此又提出了一个在原生分辨率下更严格的三轴评估协议。
- 在 ImageNet 512×512 上,论文报告 pixel-space FID 1.43,采样计算量最多减少 50%;2B 模型达到了 1.3 的新 SOTA。论文还称该方法无需额外算法改动,就能把视频生成的 Kinetics-600 FVD 推到 0.84。
所属事件:WaiT模型用频率感知流匹配降采样算力(2 条相关)→
「多模态」频道最新
- Fizgig 上线 MiniMax H3 实验性 LoRA 训练,模型文件约 15.7GB — shootthesound · 2026-08-04
- MiniMax H3 开放权重并支持 15 秒 2K 视频生成 — petrusenko_max · 2026-08-04
- MiniMax H3 用《办公室》梗图式提示词做出一镜到底 demo — venturetwins · 2026-08-04
- 把预置着色器和素材交给 Claude 生成游戏世界 — mathemagic1an · 2026-08-04
- invideo 的 Agent Two 加入 Notebooks,精细控制图像视频音频生成 — azed_ai · 2026-08-04
- MiniMax H3 首日实测:参考图拉满更能稳住人物和纹理 — jozbgm · 2026-08-04