VibeEdit 用画布标注替代文字提示,相似物体编辑 rubric 分达 79.9
Sydney-Uni · hf · 2026-10-09
文字引导的图像编辑中,描述改动容易,但在多个相似物体中指认目标区域很麻烦。悉尼大学提出 VibeEdit,让用户直接在图上放置空间标记和简短注释,组成「画布指令」来指定在哪改、改什么,无需单独文字提示。
- 支持物体添加、移除、替换、属性修改与移动
- 构建 155 万条带物体掩码和结构化描述的编辑对,基于 Qwen-Image-Edit 改造,采用层解耦条件编码分别处理源图与画布指令
- 训练采用区域加权 SFT + rubric 引导的强化学习
- 在 419 例人工策划基准上,rubric 分 79.9、区域外 PSNR 32.8 dB,显著高于最强文字指令基线 FireRed 的 67.4 和 24.0 dB
「多模态」频道最新
- TerraVis:用 MLLM 工作流量化文生图的「世界一致性」缺陷 — the-aiml · 2026-10-09
- LMArena 后训练配方:偏好+细则奖励组合,Flux2dev Elo 提升 69 分 — lmarena-ai · 2026-10-09
- 听声音就能认出 Opus 生成的视频,音画同步节奏成新指纹 — hudzah · 2026-10-09
- 孙悟空骑虎下山:AI 视频再现《大圣归来》级国风名场面 — lucky-plume · 2026-10-09
- 自回归检索器 ARR:用已检索条目反馈迭代优化查询理解 — _reachsumit · 2026-10-09
- 索尼 Syn-Omni:共享 LoRA 加模态专家路径,81 项任务领先全模态嵌入基线 — _reachsumit · 2026-10-09