EG-FM 新训练法:不改主干网络,像素级图像生成 FID 降至 1.45
burny_tech · x · 2026-08-10
论文 Energy-Guided Flow Matching (EG-FM) 提出了一种针对像素空间图像生成模型的新训练路径。
- 核心改进:传统 Flow Matching 方法将噪声直接推向固定的清晰图像终点,而 EG-FM 引入了一个动态移动的终点。它基于图像自身的频谱能量,采用由粗到细的生成轨迹——先聚焦低频的全局结构,再逐步释放高频细节。
- 零成本接入:该框架无需修改模型主干网络或训练数据,对训练和推理阶段造成的额外成本微乎其微。
- 评测效果:在 ImageNet 256x256 图像生成任务中,以更少的 epoch 达到了更低的 FID(200 epoch 达 1.55,600 epoch 达 1.45)。在 512x512 高分辨率微调上仅需 40 步即达 1.58。迁移至文生图任务后,GenEval 得分为 0.85,DPG-Bench 得分为 83.9。
所属事件:EG-FM 新方法提升像素级图像生成效率(2 条相关)→
「多模态」频道最新
- 用户付费 70 美元用 Seedance,等 5 小时仍未生成 — BLUECOW009 · 2026-08-10
- AI 重现《火影忍者》引争议:技术惊艳但内容依然糟糕 — gdechichi · 2026-08-10
- AI 音乐视频迭代进步:口型与卡点舞蹈同步效果显著提升 — bennash · 2026-08-10
- Decart AI 推出实时试衣 Chrome 插件 Anywear — sophiamyang · 2026-08-10
- Krea2 Raw模式下角色LoRA失效,开发者求助工作流 — maxiedaniels · 2026-08-10
- Minimax H3视频模型图生图能力惊艳,开发者探索单图生成工作流 — ColdExample · 2026-08-10