图像理解与生成同一步纠错
google · hf · 2026-07-17
让图像理解和生成在同一步里互相纠错
这篇工作提出 SC-CMJP(Self-Correcting Coupled Markov Jump Processes)和对应采样器 CO₂Jump,核心想法是:图像生成/理解不该是互不相干的两条线,而是一个“彼此修正”的耦合过程。作者认为,现有 masked diffusion 的采样方式要么交错解码、要么并行更新,但很难在同一步中让两种模态实时互相检查;而且由于模型不能重新 mask,跨模态冲突一旦出现就难以修复。
方法
- 用一个模态的转移速率去依赖另一个模态的置信度
- 引入 remasking jump:当跨模态证据反对当前决策时,撤回已做出的承诺
- 基于这个机制,提出训练免费的单次采样器 CO₂Jump
数据与评测
作者还构建并将发布三套大规模联合多模态生成语料:
- JEdit-1M
- JMaze-200K
- JNono-200K
配套基准覆盖分布内与分布外场景。实验显示,CO₂Jump 在图像理解与编辑、视觉推理(如迷宫和数独式任务)上都取得了最好表现,而且采样步数越多性能越好,说明跨模态耦合的收益会在轨迹中持续累积。
所属事件:谷歌新研究实现图像理解与生成同步纠错(2 条相关)→
「多模态」频道最新
- FastH3-Live 升至 22fps:加速节点实测与 ComfyUI 显存避坑 — spartong945 · 2026-09-11
- Midjourney 风格参考分享:--sref 2912175708 — tisch_eins · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11
- Hailuo 转推:MiniMax H3 MAX 一发生成 15 秒美食动画短片 — Hailuo_AI · 2026-09-11
- MiniMax Music 制作工具包 2.5 发布,新增完整母带处理链 — Vivid_Promise1700 · 2026-09-11
- ComfyUI 新节点发现器上线:按 star 增速过滤最新热门节点 — Luke2642 · 2026-09-11