上交团队提出A²-Edit:粗略掩码即可实现高质量参考图引导编辑
机器之心 · wechat · 2026-07-31
上海交通大学联合上海创智学院提出 A²-Edit 框架,旨在解决参考图引导图像编辑中跨类别统一建模难、过度依赖精细掩码的痛点。
核心设计:
- 混合 Transformer 专家路由:将条件路由扩展至注意力与前馈网络联合建模,针对不同类别对象(如服装、人像、建筑)动态选择专家分支。
- 掩码退火训练(MATS):分阶段逐步放宽掩码精度,使模型从依赖严格边界过渡到依靠上下文语义推理,最终仅需粗略涂抹或边界框即可完成编辑。
- UniEdit-500K 数据集:团队自建包含 50 万组图像对、覆盖 8 大类 209 个细分类别的数据集,打破数据同质化瓶颈。
实验表现: 在多项量化指标与 24 人用户研究中均取得最优偏好。模型在从精细掩码切换到粗掩码时性能几乎无损,但在掩码范围过大且缺乏文本提示时仍存在解释歧义,且当前显存要求较高(约 42GB)。
「多模态」频道最新
- Fish Audio 获 5200 万美元种子轮,发布 S2.1 Pro 语音模型 — alexcovo_eth · 2026-07-31
- Midjourney 每日 SREF 分享:手绘黑白线条光影室内风 — tisch_eins · 2026-07-31
- AI视频进化史:Seedance 2.5即将登陆Higgsfield — socialwithaayan · 2026-07-31
- AI 视觉艺术:绽放的血色与烈焰之花 — TheChuckTone · 2026-07-31
- Seedance 2.5视频模型实测:高质感大片《GOLIATH》 — mementomori2344323 · 2026-07-31
- 实测对比 AI 视频处理复杂人体运动能力 — HeyAmit_ · 2026-07-31