NVIDIA 发布免编码器统一多模态模型 PixelUMM
NVIDIA 与滑铁卢大学团队合作发布 PixelUMM,一个免编码器的统一多模态模型,直接在像素空间同时完成图像与视频的理解与生成,去除了 VAE 与视觉编码器,代码和权重已开源。该模型基于 Qwen3-8B 微调,已在 Hugging Face 上架,旨在解决现有统一多模态模型架构的局限。
2026-10-02 ~ 2026-10-02 · 3 条相关
- NVIDIA 上架 PixelUMM:基于 Qwen3-8B 的图文视频理解模型 — nvidia · 2026-10-02
- NVIDIA 发 PixelUMM:免编码器统一图像视频理解与生成 — nvidia · 2026-10-02
- NVIDIA 等发布 PixelUMM:去 VAE 与视觉编码器的像素空间统一多模态模型 — CSProfKGD · 2026-10-02