48 万参数潜空间模型可清理 GPT Image 2 伪影
Parking_Baby_57 · reddit · 2026-07-27
一个 48 万参数残差模型专门清理 GPT Image 2 伪影
作者为 GPT Image 2 里常见的一类失败模式做了一个很小的后处理模型:过度锐化、亮点噪声、硬边缘以及类似鳞片的纹理伪影。项目已经开源,并提供了在线试玩、HF Space 和权重。
方法
- 先用 FLUX.2 VAE 编码图片
- 在 latent 上加一个残差:z + α·R(z)
- 再通过 VAE 解码回图像
作者认为,把问题放在 latent 空间做,比像素空间去噪更容易把“伪影纹理”和真实细节分开;模型只需要学会抑制单一失败模式,因此规模很小。
成本与局限
- 最近的 GPU 上约 0.7 秒/张(1.5MP)
- 显存约 3GB
- 不同图片最优 α 差异很大
- 它不是让图更好,而是让图更不刺眼;有时会牺牲真实细节
- 宏观结构不会变,但图像会经过 VAE 回环,未修改区域也不会像素级不变
作者还说明了训练过程比较混乱,涉及 GAN 和失败样本,后续愿意再展开。
「多模态」频道最新
- Anima 和 Illustrious 的 Danbooru 标签必须是真实可搜词吗 — Manicarus · 2026-07-27
- LTX Crossview IC-LoRA 用 gizmo 实现视频镜头控制 — TomLikesRobots · 2026-07-27
- 在 ComfyUI 里,LoRA 强度和顺序通常怎么设 — Murky_Room4447 · 2026-07-27
- Anima 背景更稳但角色不一致,用户问 LoRA 能否解决 — Capital-Caregiver818 · 2026-07-27
- ComfyUI 实测:两张 RTX 5080 还是跑不过一张 RTX 5090 — Geekdomo · 2026-07-27
- InVideo Agent One 在独立视频代理榜单夺得第一 — aziz4ai · 2026-07-27