图像理解与生成同一步纠错
google · hf · 2026-07-17
## 让图像理解和生成在同一步里互相纠错 这篇工作提出 **SC-CMJP**(Self-Correcting Coupled Markov Jump Processes)和对应采样器 **CO₂Jump**,核心想法是:图像生成/理解不该是互不相干的两条线,而是一个“彼此修正”的耦合过程。作者认为,现有 masked diffusion 的采样方式要么交错解码、要么并行更新,但很难在同一步中让两种模态实时互相检查;而且由于模型不能重新 mask,跨模态冲突一旦出现就难以修复。 ### 方法 - 用一个模态的转移速率去依赖另一个模态的置信度 - 引入 **remasking jump**:当跨模态证据反对当前决策时,撤回已做出的承诺 - 基于这个机制,提出训练免费的单次采样器 **CO₂Jump** ### 数据与评测 作者还构建并将发布三套大规模联合多模态生成语料: - **JEdit-1M** - **JMaze-200K** - **JNono-200K** 配套基准覆盖分布内与分布外场景。实验显示,CO₂Jump 在图像理解与编辑、视觉推理(如迷宫和数独式任务)上都取得了最好表现,而且采样步数越多性能越好,说明跨模态耦合的收益会在轨迹中持续累积。
所属事件:谷歌新研究实现图像理解与生成同步纠错(2 条相关)→
「多模态」频道最新
- 图灵深视发布图灵鉴 X,做多模态商品评估 — 机器之心 · 2026-07-21
- Hugging Face 热门模型 Diamond-1.0 主打音频到音频增强 — nineninesix · 2026-07-21
- DiffGI 用可微几何图像提升薄壳 3D 生成质量 — clovir21 · 2026-07-21
- 创作者称用 Adobe Firefly AI Assistant 完成整支短片导演 — LudovicCreator · 2026-07-21
- Reddit 实测:Krea 2 Turbo 用绕过 LoRA 找回表情能力 — YentaMagenta · 2026-07-21
- Suno v5.5、Reason Studios 和 Grok Imagine 拼出 AI 音乐梗作 — Kyrannio · 2026-07-21