UniSpace:无需 VAE 的统一视觉表示与多模态建模

meituan-longcat · hf · 2026-08-24

UniSpace 提出了一种重参数化的预训练视觉 Transformer,在单一视觉空间内统一了语义理解、高保真重建和图像生成。该方法无需单独的 VAE,实现了可扩展的多模态建模。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →