Google 等发布 CO₂Jump 采样器,让文图生成边画边自我纠错
Upstairs_Theme2785 · reddit · 2026-09-30
Google、Google DeepMind 与石溪大学的 NeurIPS 2026 合作论文,研究图文联合生成中的一致性错位:模型可以文字描述正确的迷宫解法,图上却画出另一条路径——并行生成两个模态并不能保证一致。
方法要点:
- 提出 CO₂Jump 采样器,利用文本置信度与跨模态注意力在采样过程中引导图像更新;低置信度 token 可被重新掩码并再生,允许在生成推进时修正早期决策。
- 每个去噪步只需一次模型前向传播,采样器本身无需额外训练。
评测:在图像编辑、迷宫求解和 nonogram 三类任务上评估,并发布三个数据集 JEdit-1M、JMaze-200K、JNono-200K。在 8–512 步采样范围内,CO₂Jump 是对比中唯一在编辑质量与 grounding 上都单调提升的采样器。项目页:coupled-jump.github.io
「多模态」频道最新
- ThinkV2V:先思考再编辑,5B 视频编辑模型在复杂指令上胜过 10B 基线 — Donghao Zhou · 2026-10-01
- 复旦 IDSpect:按偏旁部首拆字给奖励,提升中文文字生成结构准确率 — Fudan-University · 2026-10-01
- Imagine3D-LLM 让多模态模型先「脑补」3D 场景再答题 — kaist-ai · 2026-10-01
- JHU 新作 PowerSim:让重建场景可直接物理交互与形变渲染 — anand_bhattad · 2026-10-01
- 7000 张 Midjourney 图+Suno 配乐,Opus 5.5 全权创作 2 小时成本仅 6.8 美元 — ciguleva · 2026-10-01
- Sony AI 等发布 ST-AudioLM:一次建模声音语义与声源移动轨迹,代码已开源 — mittu1204 · 2026-10-01