ImIR 用图像自身作指令单适配器搞定六种图像修复
Süleyman Aslan · hf · 2026-09-23
ImIR 提出用「图像指令」替代文本 prompt,做一体化图像修复。
- 上一代做法:给预训练图像编辑模型加低秩适配器 + 文本 prompt 来做修复;ImIR 改为从退化图像本身推导出连续向量指令
- 图像经两条路径进入编辑器:结构走 VAE,语义指令由轻量 token mapper 产生——把退化图像的视觉-语言嵌入推向干净图像的嵌入
- 连续向量指令可缩放,对低光增强这类目标不唯一的任务能产出一族有效修复
- 仅用一个适配器、单 GPU 约 3 小时训练,就把一个 Qwen-Image-Edit 模型适配到六种任务
- 对比实验中图像指令优于同等条件的文本条件,且支持无需退化标签的任务无关修复(文本方案做不到)
「多模态」频道最新
- 博主称 Opus 5.5 一次性生成完整 newsletter 上线视频 — alex_verem · 2026-09-23
- PixVerse R2 实测:视频模型不再是片段,而是能 WASD 走进去的世界 — HeyAmit_ · 2026-09-23
- 一人包揽 AI 音乐 MV:作者实测全流程,称「单人制片厂」不到一年 — kraussian · 2026-09-23
- MiniMax H3 Ref2VA 实测:第 8 张参考图触发初始化卡死 — itchplease · 2026-09-23
- H3 长视频画质衰减有解:二次精修注入噪声稳住 latent — xyzdist · 2026-09-23
- 开发者用 Codex+GPT Image 2.5 自动生成角色替换 LoRA 数据集 — ostrisai · 2026-09-23