Google新研究:同步图像理解与生成
burny_tech · x · 2026-07-19
Google 提出 CO2Jump 模型,实现了图像的理解与生成同步进行。不同于先生成文本再出图的传统流程,该模型在扩散过程中同步更新文本和图像 token。其核心在于自我纠正机制:若早期预测有误,模型可通过跨模态注意力重新掩蔽并修正。这种在“所见、所述与所绘”间的协商能力,显著提升了联合图像编辑、迷宫求解等需要图文强一致任务的表观。
所属事件:谷歌新研究实现图像理解与生成同步纠错(2 条相关)→
「多模态」频道最新
- Midjourney 风格参考分享:--sref 2912175708 — tisch_eins · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11
- Hailuo 转推:MiniMax H3 MAX 一发生成 15 秒美食动画短片 — Hailuo_AI · 2026-09-11
- MiniMax Music 制作工具包 2.5 发布,新增完整母带处理链 — Vivid_Promise1700 · 2026-09-11
- ComfyUI 新节点发现器上线:按 star 增速过滤最新热门节点 — Luke2642 · 2026-09-11
- 用 MiniMax H3 MAX 对一只蚊子放大招,蚊子毫发无伤 — Hailuo_AI · 2026-09-11