图像理解与生成同一步纠错

google · hf · 2026-07-17

## 让图像理解和生成在同一步里互相纠错 这篇工作提出 **SC-CMJP**(Self-Correcting Coupled Markov Jump Processes)和对应采样器 **CO₂Jump**,核心想法是:图像生成/理解不该是互不相干的两条线,而是一个“彼此修正”的耦合过程。作者认为,现有 masked diffusion 的采样方式要么交错解码、要么并行更新,但很难在同一步中让两种模态实时互相检查;而且由于模型不能重新 mask,跨模态冲突一旦出现就难以修复。 ### 方法 - 用一个模态的转移速率去依赖另一个模态的置信度 - 引入 **remasking jump**:当跨模态证据反对当前决策时,撤回已做出的承诺 - 基于这个机制,提出训练免费的单次采样器 **CO₂Jump** ### 数据与评测 作者还构建并将发布三套大规模联合多模态生成语料: - **JEdit-1M** - **JMaze-200K** - **JNono-200K** 配套基准覆盖分布内与分布外场景。实验显示,CO₂Jump 在图像理解与编辑、视觉推理(如迷宫和数独式任务)上都取得了最好表现,而且采样步数越多性能越好,说明跨模态耦合的收益会在轨迹中持续累积。

所属事件:谷歌新研究实现图像理解与生成同步纠错(2 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →