MetaCanvas 入选 NeurIPS:让 MLLM 直接在潜空间做视觉规划
mohitban47 · x · 2026-10-06
MetaCanvas 被 NeurIPS 2026 接收。核心思路:多模态 LLM(MLLM)擅长推理与布局规划,但在扩散生成中常被降格为全局文本编码器;MetaCanvas 让 MLLM 直接在空间/时空潜空间中推理规划。
- 用一组可学习的 canvas tokens 通过轻量连接器把 MLLM 的规划带入扩散潜空间;可视化显示这些 token 起到「视觉规划草图」的作用,引导最终生成。
- 在三个扩散骨干上实现,覆盖六类任务:文生图、文/图生视频、图像/视频编辑、上下文视频生成,均要求精确布局、属性绑定和推理密集控制。
- 一致优于全局条件化基线,缩小多模态理解与生成之间的差距。
「多模态」频道最新
- Nano Banana 2.1 登场:多帧排版一致性大幅改进,文字更准 — ColbyHawker · 2026-10-07
- Reddit 用户发布 8 分钟 AI 生成心理惊悚短片《Prescription》 — theodore_70 · 2026-10-07
- Force Prompting 论文:视频生成模型学会 obey 物理控制信号 — creatoroff · 2026-10-07
- 实测 GPT-6 Astra 对比 Tripo:3D 工作流谁更顶? — FellMentKE · 2026-10-07
- MIT CSAIL 推出 DREAM:单模型兼懂图像理解与生成,速度快约 10% — MIT_CSAIL · 2026-10-07
- 花叔开源艺术动画 Skill:35 种艺术风格让 Claude 画出会动的画 — AlchainHust · 2026-10-06