NVIDIA 等发布 PixelUMM:去 VAE 与视觉编码器的像素空间统一多模态模型

CSProfKGD · x · 2026-10-02

NVIDIA 与滑铁卢大学团队发布 PixelUMM,一个无编码器(encoder-free)的统一图像/视频理解与生成模型,代码和权重已开源。

所属事件:NVIDIA 发布免编码器统一多模态模型 PixelUMM(3 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →